为什么本地部署是「最稳的免费 Token」
平台赠额会过期、会改限速、会因为风控被收回。开源权重不会。只要模型许可是 Apache 2.0、MIT 或 Llama Community License 这类允许自托管的协议,把权重下载到本地后,推理次数就不再由别人计费——你付出的是电费和显卡折旧。
2026 年的现实是:7B~14B 级别的开源模型在消费级显卡上已经能跑到可用速度,而 Ollama 与 vLLM 这两条路线分工明确——前者负责「装好就能用」,后者负责「并发和长上下文」。
硬件门槛:先算清楚你能跑多大
显存是唯一硬约束。经验换算(4-bit 量化,权重占用):
- 7B~8B:约 5~6 GB,RTX 3060 12G / 4060 Ti 16G 可跑
- 14B:约 9~11 GB,4060 Ti 16G、4070 Ti Super 16G 可跑
- 32B:约 20~22 GB,需要 4090 24G 或双卡
- 70B:约 40 GB 以上,需要 2×24G 或 A6000 级别
注意:权重之外还要留 KV Cache。上下文越长、并发越高,KV Cache 越大。8K 上下文下单条请求通常再吃 1~3 GB,32K 以上要按倍数预留。
纯 CPU 也能跑,但 7B 模型在普通桌面 CPU 上通常只有每秒几 token,只适合离线批处理。Apple Silicon(M 系列统一内存)是个例外:内存够大时速度尚可,适合个人日常使用。
路线一:Ollama —— 十分钟跑通第一条本地推理
操作步骤
- 安装:macOS / Windows 从官网下载安装包;Linux 用官方安装脚本。
- 拉模型:
ollama pull qwen3:8b(或llama3.1:8b、gemma3:12b,按你的显存选)。 - 直接对话:
ollama run qwen3:8b。 - 暴露 OpenAI 兼容接口:Ollama 默认在
http://localhost:11434提供/v1/chat/completions。 - 把现有应用里的 base_url 改成
http://localhost:11434/v1,api_key 随便填一个非空字符串即可。 - 用 curl 验证:
```bash
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen3:8b","messages":[{"role":"user","content":"hi"}]}'
```
关键配置
OLLAMA_HOST=0.0.0.0:11434:局域网内其他设备也能调用。OLLAMA_KEEP_ALIVE=30m:让模型常驻显存,避免每次冷启动。OLLAMA_NUM_PARALLEL:并发请求数,设太大反而拖慢单条速度。- 上下文长度在 Modelfile 里用
PARAMETER num_ctx调整,默认值往往偏小,长文档场景要手动拉高。
路线二:vLLM —— 要吞吐和长上下文就换它
Ollama 适合单人或小团队,但并发一上来就会排队。vLLM 的 PagedAttention 与连续批处理能把吞吐拉高数倍,是自建服务端的主流选择。
操作步骤
- 建议用 Linux + NVIDIA GPU,先装好匹配的 CUDA 驱动。
- 建虚拟环境并安装:
pip install vllm(按官方文档选择与 CUDA 版本匹配的安装方式)。 - 启动 OpenAI 兼容服务:
```bash
vllm serve Qwen/Qwen3-8B \
--max-model-len 32768 \
--gpu-memory-utilization 0.90 \
--port 8000
```
- 客户端把 base_url 指向
http://localhost:8000/v1。 - 多卡或显存吃紧时用
--tensor-parallel-size 2做张量并行。
关键参数
--gpu-memory-utilization:默认 0.9,显存小时调低,否则启动即 OOM。--max-model-len:直接决定 KV Cache 占用,长上下文务必显式设置。--quantization:支持 AWQ / GPTQ / FP8 等,量化后显存需求显著下降。--max-num-seqs:并发上限,配合显存调参。
把本地模型接进现有工作流
- 代码补全:VS Code 的 Continue、Cline 等插件都支持自定义 OpenAI 兼容端点,填本地地址即可。
- 命令行:任何支持
OPENAI_BASE_URL环境变量的 CLI 工具都能指向本地。 - 桌面客户端:Cherry Studio、Chatbox 一类工具支持添加自定义 API 地址。
- 自建网关:用 LiteLLM 之类做一层代理,把本地模型和云端模型放在同一个路由下,按任务分流——敏感的走本地,难的走云端。
注意事项
- 许可要看清:Llama 系列有自己的社区许可,商用前确认条款;Apache 2.0 / MIT 的模型(如 Qwen、Mistral 的部分版本)限制更少。
- 量化有代价:4-bit 量化在多数任务上损失可接受,但数学推理和长链推理会明显退化,重要任务建议用 8-bit 或原始精度。
- 安全边界:把端口暴露到公网前必须加鉴权,本地服务默认没有认证。
- 电费与散热:长期满载运行的家用显卡,电费和噪音都是真实成本。
- 不是所有任务都适合本地:需要最强推理能力时,本地 8B 模型和云端旗舰仍有明显差距,混合使用更现实。
- 版本会变:模型名、启动参数在不同版本间会调整,以官方仓库 README 为准。
适用场景
- 高频、短请求的批量任务:文本分类、抽取、翻译、数据清洗,本地跑几乎没有边际成本。
- 数据不能出内网:合同、病历、内部代码等敏感内容。
- 离线或弱网环境:现场部署、边缘设备。
- 学习与调试:想搞清推理、量化、KV Cache 到底怎么工作。
一句话结论
如果你的调用量足够大、或者数据敏感,本地部署开源模型是 2026 年最可控的「免费 Token」方案——成本从按次计费变成一次性硬件投入,剩下的只是调参。