Ollama:本地大模型推理利器 2026 版

Ollama 让你离线运行 LLaMA、Mistral、Phi 等大模型。支持 Mac、Linux、Windows。CLI 和 API。

  • ⭐ 42000
  • Go
  • Python
  • Apache 2.0
  • 更新于 2026-05-18

什么是 Ollama? #

Ollama 是本地运行大语言模型的工具。它封装了模型下载、量化、推理,支持多平台(Mac、Linux、Windows)。

安装 #

Mac #

brew install ollama
ollama serve  # 启动守护进程

Linux #

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable --now ollama

Windows #

winget install ollama

常用模型 #

模型参数量用途
llama27B/13B通用对话
mistral7B代码、写作
phi2.7B轻量推理
gemma2B/7B谷歌开源
qwen7B/14B超大模型

基础用法 #

拉取模型 #

ollama pull llama2
ollama pull mistral

对话模式 #

ollama run llama2

API 调用 #

curl http://localhost:11434/api/generate -d '{
  "model": "llama2",
  "prompt": "什么是 AI?"
}'

Python 客户端 #

import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={'model': 'llama2', 'prompt': '解释下面的代码:'}
)
print(response.json()['response'])

量化模型 #

量化选项 #

  • Q4_0:4 位,平衡质量与大小
  • Q4_1:4 位,较 Q4_0 更精确
  • Q5_0:5 位,更好质量
  • Q8_0:8 位,接近原始

查看模型信息 #

ollama show llama2
ollama list

集成 LangChain #

from langchain_community.llms import Ollama

llm = Ollama(model="llama2")
result = llm.invoke("解释量子计算")

多模态模型 #

LLaVA #

ollama pull llava
ollama run llava "这张图片在说什么?" --image path/to/image.jpg

生产部署 #

Docker 镜像 #

FROM ollama/ollama
RUN ollama pull llama2
CMD ["ollama", "serve"]

与 Web UI 集成 #

# 运行 Ollama + Open WebUI
docker run -d -p 11434:11434 --name ollama ollama/ollama
docker run -d -p 3000:8080 --gpus all --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui-1 ghcr.io/open-webui/open-webui

性能调优 #

系统要求 #

模型推荐内存GPU 显存
7B16GB+8GB
13B32GB+12GB
34B64GB+24GB

优化参数 #

# 设置线程数
export OLLAMA_NUM_THREADS=8

# 调整并行度
export OLLAMA_MAX_LOADED_MODELS=2

常见问题 #

Q: Ollama 支持中文吗?

答:支持。LLaMA、Mistral 等模型有中文训练。

Q: 如何卸载模型?

答:ollama rm llama2 或删除 ~/.ollama/models

Q: 能否离线使用?

答:可以。下载后完全离线运行。

总结 #

Ollama 是本地 AI 部署的利器。免 API 调用、隐私安全、随时可访问。


参考:ollama.com 文档 更新:2026-05-18

📦 出现在以下合集中

💬 留言讨论