廉价LLM Stack2026:$5-20/月替代$100+ SaaS 聊天LLM

5 层自托管 LLM 栈实现 $5-20/月替代 $100+/月 SaaS:本地嵌入(nomic-embed-text)→ 本地聊天(DeepSeek/R1 via Ollama)→ 路由(LiteLLM)→ 缓存(Redis)→ 监控(Grafana)。比 ChatGPT Plus 便宜 95%。

  • Python
  • Docker
  • Go
  • Rust
  • MIT
  • 更新于 2026-05-21

大多数“法学硕士成本优化”建议只是“使用更便宜的模型”。 这个系列更加雄心勃勃:一个由 5 个组件组成的堆栈,可处理实际生产工作负载 - 编码代理、内容生成、搜索、基本代理 - 每月总计 0-15 美元。 不是业余爱好设置。 不是“适合每天 100 个请求”。 以 SaaS 杀手级价格提供真实的日常驾驶员推理。

诀窍不是任何单一的工具——而是编排。 免费等级限制请求,而不是输出。 本地模型限制质量,而不是要求。 令牌压缩减少了计费支出。 智能路由将每项任务发送给最便宜的有能力的提供商。 综合起来,数学就变得荒谬了。

TL;DR — The Stack at a Glance #

#ComponentCostRoleDeep dive
1Ollama (local)$0Heavy/sensitive workloads on your hardwareOllama guide
2DeepSeek API$2-8/moCheap inference for hard tasks ($0.27/M input vs $3 Claude)DeepSeek vs OpenAI
3Gemini CLI free tier$01,000 req/day for general LLM tasks, freeAI Search Tools
4RTK proxy$0 (self-host)Compress prompts 20-40% before they hit billable APIsRTK setup
59Router$0 (self-host)Auto-route per task to cheapest competent provider9Router guide

每月总费用(轻型:100 次调用/天):0-3 美元中度(500 次调用/天):2-8 美元重度(2000 次调用/天):5-15 美元

与相同数量的纯 API 相比:分别为 40 美元/200 美元/800 美元。 在生产规模上成本降低 20-50 倍

1. Why “Cheap” Got Viable in 2026 #

过去 12 个月发生了三件事变化:

  1. DeepSeek-V4 以 1/10 的价格达到 Claude Sonnet 的质量(0.27 美元/月 vs 3 美元/月输入)。 对于 80% 的任务来说,质量差距并不重要。
  2. 免费层变得严肃:Gemini 每天提供 1,000 个免费请求,GLM-4.6 提供免费层,OpenRouter 轮换社区赞助的免费模型。 合并预算 = 每天约 3,000 次免费通话。
  3. RTK(重复令牌压缩)起作用:删除 20-40% 的纯粹冗余令牌(文件头、每个会话重复 10 次的系统提示)。

将这三者叠加起来——本地回退+廉价的API+免费层轮换+压缩——最便宜的质量前沿会发生巨大的变化。

2. Architecture — The Smart Router Pattern #

   Your app
       │
       ▼
   9Router (decides where each call goes)
       │
       ├─► Local Ollama         (sensitive / offline / draft work)
       │
       ├─► RTK proxy → DeepSeek (hard tasks needing quality, compressed)
       │
       ├─► Gemini free tier     (1k req/day, easy tasks)
       │
       └─► OpenRouter free      (rotating community models, experiments)

每个提供商都有一个“专业区”。 9Router(如果您不需要其他服务,则可以使用 10 行 Python 包装器)检查任务并相应地进行路由。

3. Component 1 — Ollama (Local, $0) #

角色:任何敏感的事情,任何你不想收费的事情,任何草稿质量的事情。

在消费类硬件上切合实际(2026 年数字):

  • 8 GB RAM(M1 / 中档 PC):Llama 3.2 3B,20+ tok/s — 适合自动完成、分类、草稿编写
  • 16 GB RAM(M2/M3 / 不错的 PC):Qwen 3 Coder 14B,15 tok/s — 生产编码工作
  • 32 GB RAM(Mac Studio /工作站):Llama 3.3 70B Q4,8 tok/s — 为患者提供 Claude Sonnet 级质量

永久免费,无费率限制。 唯一的成本是运行机器的电力。

完整安装+模型选择:Ollama制作指南

4. Component 2 — DeepSeek API ($2-8/Month) #

角色:当本地服务不够好时,这是您的默认付费提供商。

为什么这在价格/质量上击败了所有人

  • $0.27/M 输入代币 (DeepSeek-V4) vs $3/M (Claude Sonnet) vs $2.50/M (GPT-5)
  • 与 Claude Sonnet 的代码基准差距:平均约 5%
  • 非高峰时段额外提供50%折扣(UTC 16:30-00:30)

诚实的权衡:对利基主题的幻觉稍微多一些。 冷启动时速度稍慢。 批量推理成本节省 11 倍,值得。

快速启动 — 在 platform.deepseek.com 上注册,10 美元的积分可供大多数独立开发者使用 2-3 个月。

完整设置 + 何时使用 DeepSeek:DeepSeek-V4 与 OpenAI API 比较。

5. Component 3 — Gemini CLI Free Tier ($0) #

角色:每天免费 1,000 个请求,用于一般任务(问答、总结、简单编码)。

计算:每天 1,000 次调用 × 30 天 = 每月 30,000 次免费调用。 如果您在 UTC 午夜之前完成了它,则可以回到 DeepSeek 来完成剩下的工作。

要点:Google 会在免费套餐中记录您的“模型改进”提示 — 不要发送专有代码或 PII。

快速安装

npm install -g @google/gemini-cli
gemini auth login  # opens browser, uses your Google account
gemini "explain this regex: /^[a-z]+$/i"

或者直接通过 Gemini REST 端点访问 API — 同样是 1,000/天的预算。

Gemini、Perplexity 和 ChatGPT 免费套餐以及各自优势的同伴概述: AI 搜索工具比较

6. Component 4 — RTK Proxy ($0, Self-Host) #

角色:位于您的应用程序和任何付费 API 之间。 在每次调用之前压缩重复的内容(系统提示、文件头、文档片段)。 无需更改代码即可节省 20-40% 的费用。

机制:语义重复数据删除。 如果您今天发送相同的 2,000 令牌系统提示 50 次,RTK 在第 2 次调用中会识别它并发送一个指针而不是全文。

快速安装

docker run -d --name rtk -p 8765:8765 \
  ghcr.io/rtk-ai/rtk:latest

然后将 API 基本 URL 从“https://api.deepseek.com/v1”更改为“http://localhost:8765/v1/deepseek”。 完毕。

全面深入了解 RTK 的工作原理 + 基准测试:RTK Rust CLI 代理 + 令牌保护程序。

7. Component 5 — 9Router ($0, Self-Host) #

角色:协调者。 根据任务类型、剩余预算和提供商可用性来决定哪个提供商接听每个呼叫。

为什么需要它:如果没有 9Router,您每次调用都要手动选择提供商。 使用 9Router,您只需设置一次规则(“编码任务 → 通过 RTK 进行 DeepSeek,简单问答 → Gemini 自由,回退 → Ollama”),然后就可以忘记它。

奖励:9Router 为优质提供商提供了自己的 RTK 压缩层,并在免费套餐达到每日上限时自动回退。

快速安装

docker run -d --name 9router -p 9999:9999 \
  -e PROVIDERS=ollama,deepseek,gemini,openrouter \
  ghcr.io/rtk-ai/9router:latest

完整配置+免费层编码组合食谱: 9Router智能代理指南

8. The Routing Table — Who Handles What #

对于单独开发者来说可行的默认路由配置:

Task typeProviderWhy
Inline code completionOllama (Qwen 3 Coder 14B local)Latency matters more than quality
Code generation (function-scope)DeepSeek-V4 via RTKQuality matters, compress to save
Multi-file refactorDeepSeek-V4 via RTK or Claude fallbackHard task, fall back to premium if DeepSeek struggles
General Q&A / explain codeGemini free tierFree, fast, good enough
Web search + citeGemini free tier (built-in grounding)Free vs $20/mo Perplexity Pro
Sensitive code reviewOllama localNever leaves your machine
Bulk content gen (1000+ articles)DeepSeek-V4 off-peakCheap × 50% off-peak = $0.135/M
Simple agent (Slack bot, scheduler)Gemini free tierEasy tasks, 1k/day plenty

9. The $0-15/Month Math #

少量使用(单独开发,平均每天 100 次调用):

  • Gemini 免费承保约 70% 的通话 → 0 美元
  • 其他 30% 的 DeepSeek(约 900 次调用/月,大部分是小规模)→ 1-3 美元
  • Ollama 敏感(无 API 成本)→ 0 美元
  • 总计:1-3 美元/月(对比 40+ 美元的纯 API)

中等使用量(每天 500 次调用,包括一些编码):

  • Gemini 免费:仍然有约 1000 个通话/天可用
  • DeepSeek 进行严格编码:~3000 次调用/月,采用 RTK 压缩 → $3-8
  • 奥拉马作为后备 → $0
  • 总计:3-8 美元/月(相对于 200 美元以上的纯 API)

大量使用(每天 2000 个呼叫,代理工作流程):

  • 双子座到上午 10 点就精疲力尽,后备开始
  • DeepSeek 重载,RTK 节省约 30% → $5-12
  • 非高峰批处理作业 → 额外节省 50%
  • Ollama 处理批量分类,敏感 → $0
  • 总计:5-15 美元/月(对比 800+ 美元的纯 API)

10. Day 1 Setup Order (60 minutes) #

  1. Ollama(15 分钟)— 安装、拉取 Llama 3.2 3B + Qwen 3 Coder 14B
  2. DeepSeek 帐户(5 分钟)— 注册、获取 API 密钥、充值 10 美元
  3. Gemini CLI(5 分钟)— npm i -g @google/gemini-cli,使用 Google 进行身份验证
  4. RTK 代理(10 分钟)— Docker 运行,指向 DeepSeek
  5. 9Router(10 分钟)— Docker 运行,配置 4 个提供商
  6. 测试路由(15 分钟)— 发送 5 个不同的任务类型,验证每个任务是否命中预期的提供者

60 分钟后,您的计算机上就会拥有一个真正的生产级廉价 LLM 路由器。

11. When to Upgrade (and to What) #

$0-15 堆栈一直有效,直到您达到以下任一条件:

  • 延迟要求 < 500ms — 添加 Claude/GPT-5 作为热路径(仍保留 DeepSeek 进行批处理)
  • 合规性要求仅提供美国数据的提供商 — 放弃 DeepSeek + Gemini,使用 OpenRouter 进行提供商过滤或自托管更多
  • 批量工作负载需要 SLA — 添加具有多个付费提供商的托管 LiteLLM 网关 + 重试逻辑(请参阅 LiteLLM gateway 2026
  • 您想要完全可观察性 - 添加 Portkey(花费 1000 美元,平台费用为 49 美元,请参阅 Portkey vs LiteLLM 2026

要点:这个堆栈不是天花板。 它可以让您有意识地扩大支出,而不是从第一天起就被迫购买 200 美元/月的 SaaS 捆绑包。

TL;DR — The Recipe #

5 种工具,每月 0-15 美元,60 分钟设置

  1. Ollama — 本地且敏感
  2. DeepSeek-V4 — 用于困难任务的廉价 API
  3. Gemini CLI 免费套餐 — 1k 请求/天免费普通法学硕士
  4. RTK 代理 — 计费 API 节省 20-40% 的代币
  5. 9Router — 智能路由编排器

Stack pays for itself if you currently spend $30+/mo on any AI SaaS. Spin it up on your laptop (no VPS needed for cheap-LLM specifically — though a $6/mo DigitalOcean droplet helps if you want it always-on for a team).


如果您想要完整的编码堆栈,请将此集合与自托管 AI 编码工作流程配对 - 它们共享 Ollama + 9Router + RTK 作为基础。

💬 留言讨论