为什么「本地部署」才算真正免费

所有云端的免费额度都有三个共同限制:额度会过期、速率会被限、条款会变。本地部署的逻辑完全不同——你付出的是一次性的硬件成本 + 电费,换来的是不计量、不限速、不联网的推理能力。

代价也很明确:模型能力受限于你的显存,运维要自己扛。所以这不是「白嫖云端旗舰模型」的替代品,而是高频、低敏感、可批量任务的成本归零方案。

方案一:Ollama —— 最低门槛的本地推理

Ollama 是目前上手成本最低的本地模型运行时,支持 macOS / Linux / Windows,自带模型拉取、量化版本管理和 OpenAI 兼容接口。

操作步骤

  1. 安装:从 ollama.com 下载对应平台安装包;Linux 可用官方一键脚本安装。
  2. 拉模型:ollama pull qwen3:8b、ollama pull llama3.1:8b、ollama pull deepseek-r1:7b 等。冒号后是参数量与量化标签,不带标签通常默认 4-bit 量化。
  3. 跑起来:ollama run qwen3:8b 进入交互;或 ollama serve 启动服务,默认监听 127.0.0.1:11434。
  4. 接入现有工具:Ollama 提供 OpenAI 兼容端点 http://localhost:11434/v1,把 API Key 随便填一个非空字符串即可,多数支持自定义 base_url 的客户端(如各类 IDE 插件、聊天前端、脚本库)都能直接接。
  5. 常驻与开机自启:Linux 用 systemd 单元,macOS 用 launchd 或菜单栏设置里的开机启动。

硬件门槛(经验值,非硬性)

  • 7B~8B 4-bit 量化:约 5~6 GB 显存,或 16 GB 统一内存的 Apple Silicon。
  • 14B 4-bit:约 9~10 GB 显存。
  • 32B 4-bit:约 20 GB 显存,消费级单卡需 24 GB 档位。
  • 纯 CPU 也能跑,但 7B 级别通常只有每秒几个 token,只适合离线批处理。

限制

  • 上下文越长,显存占用越高;长文档任务要留足余量。
  • 并发能力弱,Ollama 更适合单人、单会话场景。
  • 模型更新需要手动 pull,没有自动升级。

方案二:vLLM —— 高吞吐批量推理

如果你要一次处理几千条数据(分类、抽取、改写、打标),Ollama 的吞吐会成为瓶颈。vLLM 靠 PagedAttention 和连续批处理,在同一张卡上能把吞吐提高数倍到十几倍。

操作步骤

  1. 环境:推荐 Linux + NVIDIA GPU,用官方 Docker 镜像最省事;也可 pip install vllm(对 CUDA 版本有要求)。
  2. 起服务:

```bash

vllm serve Qwen/Qwen3-8B \

--served-model-name qwen3-8b \

--max-model-len 8192 \

--gpu-memory-utilization 0.90 \

--port 8000

```

启动后自动暴露 OpenAI 兼容接口 /v1/chat/completions。

  1. 调参:--max-model-len 控制上下文上限,直接决定显存占用;--gpu-memory-utilization 控制 KV Cache 预留比例;吞吐优先可加 --max-num-seqs。
  2. 批量调用:用官方 openai Python SDK 指向本地地址,配合 asyncio 并发发送,几百条请求能跑满 GPU。
  3. 量化:显存不够时用 AWQ / GPTQ 量化权重,或启用 FP8(Hopper 及更新架构)。

限制

  • 安装对 CUDA、驱动、PyTorch 版本敏感,版本不匹配是最常见的报错来源。
  • 首次加载模型需要几十秒到几分钟,不适合频繁重启。
  • 多卡需要正确配置张量并行,否则会 OOM。

两者怎么选

| 场景 | 推荐 |

| --- | --- |

| 个人日常问答、写作辅助 | Ollama |

| 本地 IDE 代码补全 | Ollama |

| 上万条数据批处理 | vLLM |

| 多用户共享一个推理服务 | vLLM |

| 只有 Mac、没有独显 | Ollama |

注意事项

  1. 别把服务暴露到公网。Ollama 和 vLLM 默认都没有鉴权,直接映射端口等于把 GPU 送人。需要远程访问时走 SSH 隧道或加反向代理鉴权。
  2. 量化有代价。4-bit 量化在多数任务上损失可接受,但在数学推理、长链逻辑上会明显退化,敏感任务建议用 8-bit 或全精度。
  3. 许可证要看清。开源权重不等于随便商用,部分模型有自定义许可条款,商用前务必核对。
  4. 电费也是成本。一张 300W 的卡满载跑一天约 7 度电,长期高频使用要算进总账。
  5. 模型选择比参数重要。同尺寸下不同模型的实测表现差异很大,建议用自己的真实任务做小样本对比,而不是只看榜单。

适用场景

  • 数据不能出内网的合规场景。
  • 需要反复调试 prompt、调用量极大的开发阶段。
  • 断网环境、边缘设备、离线批处理。
  • 作为云端 API 的降级备份:云端限流或涨价时,本地服务立刻顶上。

一句话结论

如果你有可用的 GPU 或大内存 Mac,本地部署是唯一能把 Token 成本压到「只剩电费」的方案。用 Ollama 起步,用 vLLM 扩容,两者都走 OpenAI 兼容接口,切换成本几乎为零。