Ollama:本地大模型推理利器 2026 版
Ollama 让你离线运行 LLaMA、Mistral、Phi 等大模型。支持 Mac、Linux、Windows。CLI 和 API。
- ⭐ 42000
- Go
- Python
- Apache 2.0
- 更新于 2026-05-18
什么是 Ollama? #
Ollama 是本地运行大语言模型的工具。它封装了模型下载、量化、推理,支持多平台(Mac、Linux、Windows)。
安装 #
Mac #
brew install ollama
ollama serve # 启动守护进程
Linux #
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama
Windows #
winget install ollama
常用模型 #
| 模型 | 参数量 | 用途 |
|---|---|---|
| llama2 | 7B/13B | 通用对话 |
| mistral | 7B | 代码、写作 |
| phi | 2.7B | 轻量推理 |
| gemma | 2B/7B | 谷歌开源 |
| qwen | 7B/14B | 超大模型 |
基础用法 #
拉取模型 #
ollama pull llama2
ollama pull mistral
对话模式 #
ollama run llama2
API 调用 #
curl http://localhost:11434/api/generate -d '{
"model": "llama2",
"prompt": "什么是 AI?"
}'
Python 客户端 #
import requests
response = requests.post(
'http://localhost:11434/api/generate',
json={'model': 'llama2', 'prompt': '解释下面的代码:'}
)
print(response.json()['response'])
量化模型 #
量化选项 #
- Q4_0:4 位,平衡质量与大小
- Q4_1:4 位,较 Q4_0 更精确
- Q5_0:5 位,更好质量
- Q8_0:8 位,接近原始
查看模型信息 #
ollama show llama2
ollama list
集成 LangChain #
from langchain_community.llms import Ollama
llm = Ollama(model="llama2")
result = llm.invoke("解释量子计算")
多模态模型 #
LLaVA #
ollama pull llava
ollama run llava "这张图片在说什么?" --image path/to/image.jpg
生产部署 #
Docker 镜像 #
FROM ollama/ollama
RUN ollama pull llama2
CMD ["ollama", "serve"]
与 Web UI 集成 #
# 运行 Ollama + Open WebUI
docker run -d -p 11434:11434 --name ollama ollama/ollama
docker run -d -p 3000:8080 --gpus all --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui-1 ghcr.io/open-webui/open-webui
性能调优 #
系统要求 #
| 模型 | 推荐内存 | GPU 显存 |
|---|---|---|
| 7B | 16GB+ | 8GB |
| 13B | 32GB+ | 12GB |
| 34B | 64GB+ | 24GB |
优化参数 #
# 设置线程数
export OLLAMA_NUM_THREADS=8
# 调整并行度
export OLLAMA_MAX_LOADED_MODELS=2
常见问题 #
Q: Ollama 支持中文吗?
答:支持。LLaMA、Mistral 等模型有中文训练。
Q: 如何卸载模型?
答:ollama rm llama2 或删除 ~/.ollama/models。
Q: 能否离线使用?
答:可以。下载后完全离线运行。
总结 #
Ollama 是本地 AI 部署的利器。免 API 调用、隐私安全、随时可访问。
参考:ollama.com 文档 更新:2026-05-18
💬 留言讨论