Ollama
> Ollama — 一行命令跑起大模型,本地部署LLM从此告别环境地狱。
---
兄弟们,今天聊个能让你少掉点头发的工具——**Ollama**。
先说说我自己的血泪史。之前想跑个Llama或者通义千问玩玩,那叫一个折腾:先装Python环境,再配CUDA,然后下载模型权重,接着写加载脚本,最后可能因为transformers版本不对直接报错。一套下来,俩小时没了,热情也凉了。
后来发现Ollama,整个人都清爽了。它就是个**本地大模型运行器**,把“下载模型、配置环境、启动服务、调用API”全部压缩成一条命令。你不需要懂Python,不需要配虚拟环境,甚至不需要知道模型文件存在哪,它全包了。
**它到底解决什么问题?**
说白了,就是让“在本地跑LLM”这件事从“程序员专属”变成“谁都能上手”。你把模型当黑盒,Ollama帮你处理所有底层细节。而且它跨平台,Windows、macOS、Linux通吃,连Apple Silicon都优化好了。
---
## 下载方式
直接去官网,别去第三方下什么绿色版,没必要。
[Ollama官网下载](https://ollama.com/)
首页大按钮就是对应系统的安装包。macOS有`.dmg`,Windows有`.exe`,Linux给的是curl脚本。认准这个域名,别被钓鱼站骗了。
---
## 安装方法
**macOS / Windows**:下载完双击,一路下一步,装完就完事。记住,装完它会在后台开个服务,你不需要管它。
**Linux**(以Ubuntu为例):
```bash
curl -fsSL https://ollama.com/install.sh | sh
```
装完跑一下:
```bash
ollama --version
```
能输出版本号就说明成了。如果提示`command not found`,多半是PATH没刷新,关掉终端重开一个。
---
## 基础使用教程
### 1. 拉取并运行第一个模型
打开终端(Windows用PowerShell),输入:
```bash
ollama run llama3.2
```
第一次运行会自动下载模型(大概2-3GB,看你网速),下完直接进入交互式对话界面。你打字,它回答,跟ChatGPT网页版一样。
想退出对话?输入`/bye`回车,或者按`Ctrl+D`。
### 2. 常用模型推荐
- **llama3.2**(Meta,通用聊天,3B/1B参数,轻量适合老电脑)
- **qwen2.5**(阿里通义,中文效果好,7B/14B/72B都有)
- **mistral**(法国团队,法语/英语都行,7B)
- **gemma2**(谷歌,9B/27B,推理能力不错)
查所有可用模型:
```bash
ollama list
```
### 3. 像API一样调用
Ollama默认跑在`localhost:11434`,自带OpenAI兼容的API。你用Python或者curl都能调:
```bash
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "写一段关于秋天的诗",
"stream": false
}'
```
返回JSON,里面有`response`字段就是答案。这意味着你可以把它嵌进自己写的脚本、微信机器人、或者任何需要“本地AI”的地方。
### 4. 换模型不用删
想用另一个模型?直接:
```bash
ollama run qwen2.5:7b
```
它会自动下载新的,旧的还留着。硬盘不够了用`ollama rm llama3.2`删掉。
---
## 进阶技巧(这part才是精华)
### 技巧一:自定义模型参数
默认模型是“通用模式”,但你完全能定制。比如你想让模型回答风格更简洁,或者固定用英文,创建一个`Modelfile`:
```text
FROM llama3.2
# 设置系统提示词
SYSTEM """你是一个只回答核心观点的助手,不要废话,每条回答不超过50字。"""
# 降低温度,让回答更确定
PARAMETER temperature 0.3
```
然后构建:
```bash
ollama create my-helper -f Modelfile
```
之后用`ollama run my-helper`,它就会按你的规矩来。这招做垂直领域助手特别香。
### 技巧二:GPU不够?用CPU也能跑
Ollama默认优先用GPU,但如果你机器没独显,它会自动切CPU。不过速度会慢,建议选小模型(3B、7B)。另外在macOS上,记得把内存分配调大:
```bash
# 设置Ollama最多使用16GB内存(适合M系列芯片)
export OLLAMA_MAX_LOADED_MODELS=1
export OLLAMA_KEEP_ALIVE=24h
```
Windows用户可以在系统环境变量里加`OLLAMA_NUM_GPU=0`强制CPU模式。
### 技巧三:结合Open WebUI做成本地ChatGPT
命令行聊天还是不够爽,你可以装个Web界面:
```bash
# 先安装docker(如果没装)
# 然后一行命令启动
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
```
打开`http://localhost:3000`,注册个账号,然后在设置里把模型指向`http://host.docker.internal:11434`。搞定之后,你就有个带聊天记录、支持多会话、还能联网搜索的本地版ChatGPT了。
### 技巧四:用Ollama跑多模态
不只是文本,Ollama支持图像模型。比如`llava`或者`bakllava`:
```bash
ollama run llava
```
然后对话时直接拖一张图片进终端,它会识别图片内容。比如你发个电路板照片,让它帮你找问题,它真能说个一二三。
### 技巧五:离线部署
如果你在隔离内网(比如公司机房),可以先在有网机器上拉好模型:
```bash
ollama pull llama3.2
```
然后找到模型缓存目录(macOS是`~/.ollama/models`,Linux是`/usr/share/ollama/.ollama/models`),整个拷到U盘,再放到目标机器对应目录。启动Ollama后,`ollama list`就能看到,不用联网。
---
## 最后说点掏心窝的话
Ollama这东西,最大的价值不是“跑模型”本身,而是它把**私有化部署AI**的门槛降到了零。你现在可以完全离线、不担心隐私地使用一个不错的LLM,甚至能把它接进自己的自动化流程里。
当然,它也有缺点——模型大小受限于你的内存,跑不了70B以上的大模型;推理速度跟云端API没法比;有些冷门模型支持不及时。但作为日常工具,它绝对够用。
我现在写周报、做翻译、润色邮件,全用Ollama跑本地模型,再也不用担心把公司代码贴到云端AI里泄露了。就冲这点,值得你花十分钟装一个试试。
如果遇到问题,多看看官方文档,或者用`ollama help`。这工具社区很活跃,基本你踩过的坑,别人都踩过。
散会。