为什么本地部署是「最稳的免费 Token」

平台赠额会过期、会改限速、会因为风控被收回。开源权重不会。只要模型许可是 Apache 2.0、MIT 或 Llama Community License 这类允许自托管的协议,把权重下载到本地后,推理次数就不再由别人计费——你付出的是电费和显卡折旧。

2026 年的现实是:7B~14B 级别的开源模型在消费级显卡上已经能跑到可用速度,而 Ollama 与 vLLM 这两条路线分工明确——前者负责「装好就能用」,后者负责「并发和长上下文」。

硬件门槛:先算清楚你能跑多大

显存是唯一硬约束。经验换算(4-bit 量化,权重占用):

  • 7B~8B:约 5~6 GB,RTX 3060 12G / 4060 Ti 16G 可跑
  • 14B:约 9~11 GB,4060 Ti 16G、4070 Ti Super 16G 可跑
  • 32B:约 20~22 GB,需要 4090 24G 或双卡
  • 70B:约 40 GB 以上,需要 2×24G 或 A6000 级别

注意:权重之外还要留 KV Cache。上下文越长、并发越高,KV Cache 越大。8K 上下文下单条请求通常再吃 1~3 GB,32K 以上要按倍数预留。

纯 CPU 也能跑,但 7B 模型在普通桌面 CPU 上通常只有每秒几 token,只适合离线批处理。Apple Silicon(M 系列统一内存)是个例外:内存够大时速度尚可,适合个人日常使用。

路线一:Ollama —— 十分钟跑通第一条本地推理

操作步骤

  1. 安装:macOS / Windows 从官网下载安装包;Linux 用官方安装脚本。
  2. 拉模型:ollama pull qwen3:8b(或 llama3.1:8b、gemma3:12b,按你的显存选)。
  3. 直接对话:ollama run qwen3:8b。
  4. 暴露 OpenAI 兼容接口:Ollama 默认在 http://localhost:11434 提供 /v1/chat/completions。
  5. 把现有应用里的 base_url 改成 http://localhost:11434/v1,api_key 随便填一个非空字符串即可。
  6. 用 curl 验证:

```bash

curl http://localhost:11434/v1/chat/completions \

-H "Content-Type: application/json" \

-d '{"model":"qwen3:8b","messages":[{"role":"user","content":"hi"}]}'

```

关键配置

  • OLLAMA_HOST=0.0.0.0:11434:局域网内其他设备也能调用。
  • OLLAMA_KEEP_ALIVE=30m:让模型常驻显存,避免每次冷启动。
  • OLLAMA_NUM_PARALLEL:并发请求数,设太大反而拖慢单条速度。
  • 上下文长度在 Modelfile 里用 PARAMETER num_ctx 调整,默认值往往偏小,长文档场景要手动拉高。

路线二:vLLM —— 要吞吐和长上下文就换它

Ollama 适合单人或小团队,但并发一上来就会排队。vLLM 的 PagedAttention 与连续批处理能把吞吐拉高数倍,是自建服务端的主流选择。

操作步骤

  1. 建议用 Linux + NVIDIA GPU,先装好匹配的 CUDA 驱动。
  2. 建虚拟环境并安装:pip install vllm(按官方文档选择与 CUDA 版本匹配的安装方式)。
  3. 启动 OpenAI 兼容服务:

```bash

vllm serve Qwen/Qwen3-8B \

--max-model-len 32768 \

--gpu-memory-utilization 0.90 \

--port 8000

```

  1. 客户端把 base_url 指向 http://localhost:8000/v1。
  2. 多卡或显存吃紧时用 --tensor-parallel-size 2 做张量并行。

关键参数

  • --gpu-memory-utilization:默认 0.9,显存小时调低,否则启动即 OOM。
  • --max-model-len:直接决定 KV Cache 占用,长上下文务必显式设置。
  • --quantization:支持 AWQ / GPTQ / FP8 等,量化后显存需求显著下降。
  • --max-num-seqs:并发上限,配合显存调参。

把本地模型接进现有工作流

  • 代码补全:VS Code 的 Continue、Cline 等插件都支持自定义 OpenAI 兼容端点,填本地地址即可。
  • 命令行:任何支持 OPENAI_BASE_URL 环境变量的 CLI 工具都能指向本地。
  • 桌面客户端:Cherry Studio、Chatbox 一类工具支持添加自定义 API 地址。
  • 自建网关:用 LiteLLM 之类做一层代理,把本地模型和云端模型放在同一个路由下,按任务分流——敏感的走本地,难的走云端。

注意事项

  1. 许可要看清:Llama 系列有自己的社区许可,商用前确认条款;Apache 2.0 / MIT 的模型(如 Qwen、Mistral 的部分版本)限制更少。
  2. 量化有代价:4-bit 量化在多数任务上损失可接受,但数学推理和长链推理会明显退化,重要任务建议用 8-bit 或原始精度。
  3. 安全边界:把端口暴露到公网前必须加鉴权,本地服务默认没有认证。
  4. 电费与散热:长期满载运行的家用显卡,电费和噪音都是真实成本。
  5. 不是所有任务都适合本地:需要最强推理能力时,本地 8B 模型和云端旗舰仍有明显差距,混合使用更现实。
  6. 版本会变:模型名、启动参数在不同版本间会调整,以官方仓库 README 为准。

适用场景

  • 高频、短请求的批量任务:文本分类、抽取、翻译、数据清洗,本地跑几乎没有边际成本。
  • 数据不能出内网:合同、病历、内部代码等敏感内容。
  • 离线或弱网环境:现场部署、边缘设备。
  • 学习与调试:想搞清推理、量化、KV Cache 到底怎么工作。

一句话结论

如果你的调用量足够大、或者数据敏感,本地部署开源模型是 2026 年最可控的「免费 Token」方案——成本从按次计费变成一次性硬件投入,剩下的只是调参。