为什么是聚合网关,而不是官方 free tier
官方 free tier 的问题在于:额度小、模型旧、限速狠,而且一旦你要在多个模型之间切换,就得同时维护七八套 API Key、七八套计费逻辑。
聚合网关(aggregator gateway / 中转站)解决的是另一件事:一个 endpoint、一套 Key、一份账单,背后挂几十上百个模型。对白拿 Token 这件事来说,它有三个官方 free tier 不具备的结构性优势:
- 赠额是「网关侧」的,不占用模型厂商的 free tier——你在 OpenRouter 拿到的免费额度,和你直接在 OpenAI 注册拿到的免费额度是两条独立的线,可以叠加。
- BYOK(Bring Your Own Key)模式让网关本身不消耗额度——你把官方 Key 挂上去,网关只做路由和缓存,很多网关对 BYOK 请求不计费甚至给折扣。
- 缓存命中通常按折扣价甚至零价计费——重复 prompt、system prompt 固定、多轮对话前缀相同,这些在网关侧都能被缓存掉。
下面按「门槛从低到高」拆三类网关。
操作步骤
第一类:OpenRouter —— 免费模型池 + 缓存折扣
OpenRouter 是目前结构最清晰的聚合网关。它的免费获取路径有两条:
路径 A:models 接口筛免费模型
- 注册账号,进入 Keys 页面生成一个 API Key。
- 调用
https://openrouter.ai/api/v1/models,在返回的 JSON 里筛选pricing.prompt == "0"且pricing.completion == "0"的条目。 - 这些就是当前对所有人开放的免费模型(通常是带
:free后缀的版本,例如某些开源模型和厂商提供的试用版)。 - 直接用这个模型名发请求,额度走的是网关侧的免费池,不消耗你账号里的余额。
关键限制:免费模型通常有每日请求数上限(约几十到几百次不等,随模型和时期浮动),且限速明显低于付费模型。超过后返回 429,不是扣费。
路径 B:BYOK 模式
如果你已经在某家厂商有免费额度(比如自己注册的官方 free tier),可以在 OpenRouter 的 Integrations 里绑定该厂商的 Key。这样请求走你的官方额度,OpenRouter 只收极低的平台费或不收。适合「官方额度快过期、但想统一接口」的场景。
第二类:Cloudflare AI Gateway —— 缓存 + 日志不额外收费
Cloudflare AI Gateway 的定位不是「给你 Token」,而是「给你的 Token 省钱」。它的免费逻辑在于:
- 在 Cloudflare Dashboard 里创建 AI Gateway,拿到一个网关 URL。
- 把你的上游厂商 Key(OpenAI / Anthropic / Workers AI 等)填进去。
- 所有请求改走
https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/...。 - 在网关设置里开启 Cache,设置 TTL。
这一步才是重点:开启缓存后,完全相同的请求(相同模型、相同 messages、相同参数)在 TTL 内会直接返回缓存结果,不再打到上游,不产生上游计费。
对以下场景,缓存命中率可以很高:
- 固定的 system prompt + 少量变化的 user input(可拆分成两次请求);
- 批量任务里重复出现的分类、抽取、翻译模板;
- 开发调试阶段的重复调用。
Cloudflare 的免费计划本身包含一定量的 AI Gateway 请求和日志存储,超出部分才进入付费。具体额度以控制台显示为准。
第三类:Vercel AI Gateway —— 与部署绑定的赠额
Vercel 在 2025 年推出 AI Gateway,把它和项目部署绑定。免费获取路径:
- 在 Vercel 账号下创建 AI Gateway。
- 生成 Gateway API Key。
- 用统一 endpoint 调用多家模型(OpenAI、Anthropic、Google 等)。
- 免费额度通常随账号计划(Hobby / Pro)附带,Hobby 计划下有一定量的赠送额度,按月刷新。
注意:Vercel 的赠额和你的部署用量共享配额,如果你的项目本身流量大,赠额可能被部署请求吃掉。
通用做法:把多个网关串起来
真正把免费额度榨干的思路是分层路由:
- 本地写一个轻量路由层(几十行代码),按任务类型分流。
- 简单任务(分类、格式化)走 OpenRouter 的免费模型。
- 需要高质量输出的任务走 Cloudflare AI Gateway + 缓存。
- 高频重复任务(相同 prompt)强制走缓存路径。
- 每个网关的余额和用量写进一个简单的监控脚本,接近上限时自动切换。
注意事项
- 不要用多账号刷免费额度。主流网关都有设备指纹和支付方式关联,封号是连坐的,且会连带封掉你绑定的上游 Key。
- 免费模型池会变。厂商随时可能把某个模型从免费池移走,或调整限速。不要把生产逻辑硬编码到「某个模型一定免费」上,要定期跑一次
models接口重新筛选。 - 缓存不是万能的。只要 prompt 里有一个字符不同,缓存就不命中。要主动设计 prompt 结构(把变量放后面、把固定部分放前面)。
- BYOK 不等于免费。网关不收你钱,但上游厂商照样计费。BYOK 的价值是统一接口和利用网关的缓存/日志,不是白拿 Token。
- 免费模型的数据可能被用于训练。多数网关的免费池条款里写明会记录请求用于改进服务。涉及敏感数据不要走免费池。
- 限速是硬约束。免费池的 RPM/TPM 通常远低于付费,批量任务要加退避重试。
适用场景
- 个人开发者和独立开发者:需要快速验证多个模型,不想为每个厂商单独注册和付费。
- 原型阶段的 AI 应用:流量小、prompt 固定、对延迟不敏感,缓存命中率高。
- 批量离线任务:翻译、分类、数据清洗,可以容忍限速和排队。
- 教学和实验:给学生或团队分配统一入口,用网关侧的额度控制预算。
不适合:需要低延迟、高并发、或涉及敏感数据的生产场景。