为什么是聚合网关,而不是官方 free tier

官方 free tier 的问题在于:额度小、模型旧、限速狠,而且一旦你要在多个模型之间切换,就得同时维护七八套 API Key、七八套计费逻辑。

聚合网关(aggregator gateway / 中转站)解决的是另一件事:一个 endpoint、一套 Key、一份账单,背后挂几十上百个模型。对白拿 Token 这件事来说,它有三个官方 free tier 不具备的结构性优势:

  1. 赠额是「网关侧」的,不占用模型厂商的 free tier——你在 OpenRouter 拿到的免费额度,和你直接在 OpenAI 注册拿到的免费额度是两条独立的线,可以叠加。
  2. BYOK(Bring Your Own Key)模式让网关本身不消耗额度——你把官方 Key 挂上去,网关只做路由和缓存,很多网关对 BYOK 请求不计费甚至给折扣。
  3. 缓存命中通常按折扣价甚至零价计费——重复 prompt、system prompt 固定、多轮对话前缀相同,这些在网关侧都能被缓存掉。

下面按「门槛从低到高」拆三类网关。

操作步骤

第一类:OpenRouter —— 免费模型池 + 缓存折扣

OpenRouter 是目前结构最清晰的聚合网关。它的免费获取路径有两条:

路径 A:models 接口筛免费模型

  1. 注册账号,进入 Keys 页面生成一个 API Key。
  2. 调用 https://openrouter.ai/api/v1/models,在返回的 JSON 里筛选 pricing.prompt == "0" 且 pricing.completion == "0" 的条目。
  3. 这些就是当前对所有人开放的免费模型(通常是带 :free 后缀的版本,例如某些开源模型和厂商提供的试用版)。
  4. 直接用这个模型名发请求,额度走的是网关侧的免费池,不消耗你账号里的余额。

关键限制:免费模型通常有每日请求数上限(约几十到几百次不等,随模型和时期浮动),且限速明显低于付费模型。超过后返回 429,不是扣费。

路径 B:BYOK 模式

如果你已经在某家厂商有免费额度(比如自己注册的官方 free tier),可以在 OpenRouter 的 Integrations 里绑定该厂商的 Key。这样请求走你的官方额度,OpenRouter 只收极低的平台费或不收。适合「官方额度快过期、但想统一接口」的场景。

第二类:Cloudflare AI Gateway —— 缓存 + 日志不额外收费

Cloudflare AI Gateway 的定位不是「给你 Token」,而是「给你的 Token 省钱」。它的免费逻辑在于:

  1. 在 Cloudflare Dashboard 里创建 AI Gateway,拿到一个网关 URL。
  2. 把你的上游厂商 Key(OpenAI / Anthropic / Workers AI 等)填进去。
  3. 所有请求改走 https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/...。
  4. 在网关设置里开启 Cache,设置 TTL。

这一步才是重点:开启缓存后,完全相同的请求(相同模型、相同 messages、相同参数)在 TTL 内会直接返回缓存结果,不再打到上游,不产生上游计费。

对以下场景,缓存命中率可以很高:

  • 固定的 system prompt + 少量变化的 user input(可拆分成两次请求);
  • 批量任务里重复出现的分类、抽取、翻译模板;
  • 开发调试阶段的重复调用。

Cloudflare 的免费计划本身包含一定量的 AI Gateway 请求和日志存储,超出部分才进入付费。具体额度以控制台显示为准。

第三类:Vercel AI Gateway —— 与部署绑定的赠额

Vercel 在 2025 年推出 AI Gateway,把它和项目部署绑定。免费获取路径:

  1. 在 Vercel 账号下创建 AI Gateway。
  2. 生成 Gateway API Key。
  3. 用统一 endpoint 调用多家模型(OpenAI、Anthropic、Google 等)。
  4. 免费额度通常随账号计划(Hobby / Pro)附带,Hobby 计划下有一定量的赠送额度,按月刷新。

注意:Vercel 的赠额和你的部署用量共享配额,如果你的项目本身流量大,赠额可能被部署请求吃掉。

通用做法:把多个网关串起来

真正把免费额度榨干的思路是分层路由:

  1. 本地写一个轻量路由层(几十行代码),按任务类型分流。
  2. 简单任务(分类、格式化)走 OpenRouter 的免费模型。
  3. 需要高质量输出的任务走 Cloudflare AI Gateway + 缓存。
  4. 高频重复任务(相同 prompt)强制走缓存路径。
  5. 每个网关的余额和用量写进一个简单的监控脚本,接近上限时自动切换。

注意事项

  • 不要用多账号刷免费额度。主流网关都有设备指纹和支付方式关联,封号是连坐的,且会连带封掉你绑定的上游 Key。
  • 免费模型池会变。厂商随时可能把某个模型从免费池移走,或调整限速。不要把生产逻辑硬编码到「某个模型一定免费」上,要定期跑一次 models 接口重新筛选。
  • 缓存不是万能的。只要 prompt 里有一个字符不同,缓存就不命中。要主动设计 prompt 结构(把变量放后面、把固定部分放前面)。
  • BYOK 不等于免费。网关不收你钱,但上游厂商照样计费。BYOK 的价值是统一接口和利用网关的缓存/日志,不是白拿 Token。
  • 免费模型的数据可能被用于训练。多数网关的免费池条款里写明会记录请求用于改进服务。涉及敏感数据不要走免费池。
  • 限速是硬约束。免费池的 RPM/TPM 通常远低于付费,批量任务要加退避重试。

适用场景

  • 个人开发者和独立开发者:需要快速验证多个模型,不想为每个厂商单独注册和付费。
  • 原型阶段的 AI 应用:流量小、prompt 固定、对延迟不敏感,缓存命中率高。
  • 批量离线任务:翻译、分类、数据清洗,可以容忍限速和排队。
  • 教学和实验:给学生或团队分配统一入口,用网关侧的额度控制预算。

不适合:需要低延迟、高并发、或涉及敏感数据的生产场景。