为什么「本地部署」才算真正免费
所有云端的免费额度都有三个共同限制:额度会过期、速率会被限、条款会变。本地部署的逻辑完全不同——你付出的是一次性的硬件成本 + 电费,换来的是不计量、不限速、不联网的推理能力。
代价也很明确:模型能力受限于你的显存,运维要自己扛。所以这不是「白嫖云端旗舰模型」的替代品,而是高频、低敏感、可批量任务的成本归零方案。
方案一:Ollama —— 最低门槛的本地推理
Ollama 是目前上手成本最低的本地模型运行时,支持 macOS / Linux / Windows,自带模型拉取、量化版本管理和 OpenAI 兼容接口。
操作步骤
- 安装:从 ollama.com 下载对应平台安装包;Linux 可用官方一键脚本安装。
- 拉模型:
ollama pull qwen3:8b、ollama pull llama3.1:8b、ollama pull deepseek-r1:7b等。冒号后是参数量与量化标签,不带标签通常默认 4-bit 量化。 - 跑起来:
ollama run qwen3:8b进入交互;或ollama serve启动服务,默认监听127.0.0.1:11434。 - 接入现有工具:Ollama 提供 OpenAI 兼容端点
http://localhost:11434/v1,把 API Key 随便填一个非空字符串即可,多数支持自定义 base_url 的客户端(如各类 IDE 插件、聊天前端、脚本库)都能直接接。 - 常驻与开机自启:Linux 用 systemd 单元,macOS 用
launchd或菜单栏设置里的开机启动。
硬件门槛(经验值,非硬性)
- 7B~8B 4-bit 量化:约 5~6 GB 显存,或 16 GB 统一内存的 Apple Silicon。
- 14B 4-bit:约 9~10 GB 显存。
- 32B 4-bit:约 20 GB 显存,消费级单卡需 24 GB 档位。
- 纯 CPU 也能跑,但 7B 级别通常只有每秒几个 token,只适合离线批处理。
限制
- 上下文越长,显存占用越高;长文档任务要留足余量。
- 并发能力弱,Ollama 更适合单人、单会话场景。
- 模型更新需要手动
pull,没有自动升级。
方案二:vLLM —— 高吞吐批量推理
如果你要一次处理几千条数据(分类、抽取、改写、打标),Ollama 的吞吐会成为瓶颈。vLLM 靠 PagedAttention 和连续批处理,在同一张卡上能把吞吐提高数倍到十几倍。
操作步骤
- 环境:推荐 Linux + NVIDIA GPU,用官方 Docker 镜像最省事;也可
pip install vllm(对 CUDA 版本有要求)。 - 起服务:
```bash
vllm serve Qwen/Qwen3-8B \
--served-model-name qwen3-8b \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--port 8000
```
启动后自动暴露 OpenAI 兼容接口 /v1/chat/completions。
- 调参:
--max-model-len控制上下文上限,直接决定显存占用;--gpu-memory-utilization控制 KV Cache 预留比例;吞吐优先可加--max-num-seqs。 - 批量调用:用官方
openaiPython SDK 指向本地地址,配合asyncio并发发送,几百条请求能跑满 GPU。 - 量化:显存不够时用 AWQ / GPTQ 量化权重,或启用 FP8(Hopper 及更新架构)。
限制
- 安装对 CUDA、驱动、PyTorch 版本敏感,版本不匹配是最常见的报错来源。
- 首次加载模型需要几十秒到几分钟,不适合频繁重启。
- 多卡需要正确配置张量并行,否则会 OOM。
两者怎么选
| 场景 | 推荐 |
| --- | --- |
| 个人日常问答、写作辅助 | Ollama |
| 本地 IDE 代码补全 | Ollama |
| 上万条数据批处理 | vLLM |
| 多用户共享一个推理服务 | vLLM |
| 只有 Mac、没有独显 | Ollama |
注意事项
- 别把服务暴露到公网。Ollama 和 vLLM 默认都没有鉴权,直接映射端口等于把 GPU 送人。需要远程访问时走 SSH 隧道或加反向代理鉴权。
- 量化有代价。4-bit 量化在多数任务上损失可接受,但在数学推理、长链逻辑上会明显退化,敏感任务建议用 8-bit 或全精度。
- 许可证要看清。开源权重不等于随便商用,部分模型有自定义许可条款,商用前务必核对。
- 电费也是成本。一张 300W 的卡满载跑一天约 7 度电,长期高频使用要算进总账。
- 模型选择比参数重要。同尺寸下不同模型的实测表现差异很大,建议用自己的真实任务做小样本对比,而不是只看榜单。
适用场景
- 数据不能出内网的合规场景。
- 需要反复调试 prompt、调用量极大的开发阶段。
- 断网环境、边缘设备、离线批处理。
- 作为云端 API 的降级备份:云端限流或涨价时,本地服务立刻顶上。
一句话结论
如果你有可用的 GPU 或大内存 Mac,本地部署是唯一能把 Token 成本压到「只剩电费」的方案。用 Ollama 起步,用 vLLM 扩容,两者都走 OpenAI 兼容接口,切换成本几乎为零。