为什么绕开聚合网关

聚合网关(OpenRouter、Cloudflare AI Gateway 之类)的价值在于「一个 Key 打通多家模型」,但它的免费额度已经被大量文章写过,规则也越来越紧。真正还在持续放水的,其实是聚合层下面那些底层推理平台:它们自己也要抢开发者,所以每家都会给新账号发一笔试用额度,或者把部分开源模型挂在免费档上。

思路很简单:不通过聚合网关,直接注册底层平台 → 领各自的免费额度 → 用一个自建网关把多个平台的 Key 聚合成一个入口。这样你既拿到了各家的新用户福利,又保留了聚合网关的使用体验。

操作步骤

第一步:确定要注册哪些底层推理平台

2026 年仍在发放新用户额度、且对中国大陆用户相对友好的平台大致包括:

  • Together AI:新账号通常会给一笔试用额度,额度规模约在个位数到十几美元之间,具体数额随活动变化。平台上有若干开源模型(Llama、Qwen、DeepSeek 系列等)可以按 token 计费调用。
  • Fireworks AI:同样提供新用户试用额度,主打低延迟推理,支持函数调用与结构化输出。
  • Groq:以极快的推理速度著称,提供免费档,对部分模型有速率限制(每分钟请求数、每天 token 数),适合做原型和轻量调用。
  • DeepInfra:按 token 计费,价格较低,新用户常有小额赠送额度。
  • Novita AI:面向开发者提供免费额度与低价推理,支持多种开源模型。
  • Cerebras Inference:以超高速推理为卖点,提供免费档,适合对延迟敏感的场景。

> 注意:以上平台的免费额度政策、额度数字和可用模型会随时间和地区变化,注册前请以官网当前的定价页和活动页为准。本文不承诺任何具体数额。

第二步:用「可长期维护」的邮箱注册

不要用一次性邮箱。大多数平台会做邮箱验证,部分还会在风控时要求二次验证。建议:

  1. 用一个你能长期访问的邮箱(自建域名邮箱或主流邮箱均可);
  2. 注册时如实填写用途,写「个人开发测试」即可,不要编造公司信息;
  3. 部分平台需要绑定手机号或信用卡才能解锁全部额度,能不解锁就不解锁,先用免费档跑通再说;
  4. 同一平台不要注册多个账号来重复领额度,风控一旦命中会连带封掉主账号。

第三步:拿到 API Key 并确认额度

每个平台的控制台里通常都有:

  • API Keys 页面:生成 Key,注意只显示一次,复制后立即存到密码管理器;
  • Usage / Billing 页面:查看剩余额度、已用 token、额度到期时间;
  • Rate Limits 页面:查看免费档的 RPM(每分钟请求数)和 TPM(每分钟 token 数)。

把每个平台的「剩余额度」和「到期时间」记到一张表里,这是后面做路由决策的依据。

第四步:用自建网关把多个平台聚合成一个入口

这一步是本文的核心。你可以部署一个开源的 LLM 网关(如 One API / New API 这类支持多上游转发的项目),把上面每个平台的 Key 填进去,对外只暴露一个统一的 OpenAI 兼容接口。

大致流程:

  1. 准备一台能访问这些平台 API 的服务器(境外 VPS 最省事,国内机器需要自行解决网络问题);
  2. 部署网关程序,配置数据库与管理员账号;
  3. 在「渠道」里逐个添加上游:填入平台名、Base URL、API Key、支持的模型列表;
  4. 设置路由策略:优先走还有免费额度的渠道,额度耗尽自动切换到下一家;
  5. 生成你自己的下游 Key,交给客户端(如各类支持自定义 Base URL 的聊天客户端、IDE 插件)使用。

这样做的收益是:对外只有一个入口和一个 Key,对内自动在多家平台的免费额度之间轮换,任何一家额度用完都不会中断你的调用。

第五步:监控额度,避免突然断供

免费额度最大的风险是「你以为还有,其实已经没了」。建议:

  • 在网关上开启用量统计,按渠道维度看每天消耗;
  • 给每个渠道设一个「剩余额度低于 X 就告警」的阈值;
  • 定期(比如每周)手动登录各平台控制台核对一次,因为网关统计和平台计费可能有偏差;
  • 把即将到期的额度优先用掉,避免浪费。

注意事项

  • 免费额度有有效期。多数平台的新用户额度在注册后的一段时间内有效,过期作废,不会自动续期。
  • 免费档通常有速率限制。RPM 和 TPM 往往比付费档低很多,做批量任务时容易被限流,需要在网关侧做重试和退避。
  • 不要用免费额度跑生产业务。免费档没有 SLA,平台可能随时调整策略、下线模型或收紧限制。
  • 合规问题。部分平台的免费额度仅限个人非商业用途,商用前请阅读其服务条款。
  • 网络可达性。部分平台对特定地区有限制,注册前确认你的环境能否正常调用。
  • 不要共享 Key。把自己的下游 Key 公开分享,可能被他人刷爆额度,甚至触发平台风控。

适用场景

  • 个人开发与原型验证:需要快速试多个开源模型,但不想一开始就付费。
  • 学习与研究:跑通 RAG、Agent、函数调用等流程,验证思路是否可行。
  • 小型内部工具:调用量不大、对稳定性要求不高的内部脚本或助手。
  • 成本敏感的多模型对比:想在同一套代码里横向比较不同模型的效果,又不想为每家单独充值。

如果你需要的是稳定、可商用、有 SLA 的调用,免费额度只能作为过渡,最终还是要转向付费方案或本地部署。