为什么绕开聚合网关
聚合网关(OpenRouter、Cloudflare AI Gateway 之类)的价值在于「一个 Key 打通多家模型」,但它的免费额度已经被大量文章写过,规则也越来越紧。真正还在持续放水的,其实是聚合层下面那些底层推理平台:它们自己也要抢开发者,所以每家都会给新账号发一笔试用额度,或者把部分开源模型挂在免费档上。
思路很简单:不通过聚合网关,直接注册底层平台 → 领各自的免费额度 → 用一个自建网关把多个平台的 Key 聚合成一个入口。这样你既拿到了各家的新用户福利,又保留了聚合网关的使用体验。
操作步骤
第一步:确定要注册哪些底层推理平台
2026 年仍在发放新用户额度、且对中国大陆用户相对友好的平台大致包括:
- Together AI:新账号通常会给一笔试用额度,额度规模约在个位数到十几美元之间,具体数额随活动变化。平台上有若干开源模型(Llama、Qwen、DeepSeek 系列等)可以按 token 计费调用。
- Fireworks AI:同样提供新用户试用额度,主打低延迟推理,支持函数调用与结构化输出。
- Groq:以极快的推理速度著称,提供免费档,对部分模型有速率限制(每分钟请求数、每天 token 数),适合做原型和轻量调用。
- DeepInfra:按 token 计费,价格较低,新用户常有小额赠送额度。
- Novita AI:面向开发者提供免费额度与低价推理,支持多种开源模型。
- Cerebras Inference:以超高速推理为卖点,提供免费档,适合对延迟敏感的场景。
> 注意:以上平台的免费额度政策、额度数字和可用模型会随时间和地区变化,注册前请以官网当前的定价页和活动页为准。本文不承诺任何具体数额。
第二步:用「可长期维护」的邮箱注册
不要用一次性邮箱。大多数平台会做邮箱验证,部分还会在风控时要求二次验证。建议:
- 用一个你能长期访问的邮箱(自建域名邮箱或主流邮箱均可);
- 注册时如实填写用途,写「个人开发测试」即可,不要编造公司信息;
- 部分平台需要绑定手机号或信用卡才能解锁全部额度,能不解锁就不解锁,先用免费档跑通再说;
- 同一平台不要注册多个账号来重复领额度,风控一旦命中会连带封掉主账号。
第三步:拿到 API Key 并确认额度
每个平台的控制台里通常都有:
- API Keys 页面:生成 Key,注意只显示一次,复制后立即存到密码管理器;
- Usage / Billing 页面:查看剩余额度、已用 token、额度到期时间;
- Rate Limits 页面:查看免费档的 RPM(每分钟请求数)和 TPM(每分钟 token 数)。
把每个平台的「剩余额度」和「到期时间」记到一张表里,这是后面做路由决策的依据。
第四步:用自建网关把多个平台聚合成一个入口
这一步是本文的核心。你可以部署一个开源的 LLM 网关(如 One API / New API 这类支持多上游转发的项目),把上面每个平台的 Key 填进去,对外只暴露一个统一的 OpenAI 兼容接口。
大致流程:
- 准备一台能访问这些平台 API 的服务器(境外 VPS 最省事,国内机器需要自行解决网络问题);
- 部署网关程序,配置数据库与管理员账号;
- 在「渠道」里逐个添加上游:填入平台名、Base URL、API Key、支持的模型列表;
- 设置路由策略:优先走还有免费额度的渠道,额度耗尽自动切换到下一家;
- 生成你自己的下游 Key,交给客户端(如各类支持自定义 Base URL 的聊天客户端、IDE 插件)使用。
这样做的收益是:对外只有一个入口和一个 Key,对内自动在多家平台的免费额度之间轮换,任何一家额度用完都不会中断你的调用。
第五步:监控额度,避免突然断供
免费额度最大的风险是「你以为还有,其实已经没了」。建议:
- 在网关上开启用量统计,按渠道维度看每天消耗;
- 给每个渠道设一个「剩余额度低于 X 就告警」的阈值;
- 定期(比如每周)手动登录各平台控制台核对一次,因为网关统计和平台计费可能有偏差;
- 把即将到期的额度优先用掉,避免浪费。
注意事项
- 免费额度有有效期。多数平台的新用户额度在注册后的一段时间内有效,过期作废,不会自动续期。
- 免费档通常有速率限制。RPM 和 TPM 往往比付费档低很多,做批量任务时容易被限流,需要在网关侧做重试和退避。
- 不要用免费额度跑生产业务。免费档没有 SLA,平台可能随时调整策略、下线模型或收紧限制。
- 合规问题。部分平台的免费额度仅限个人非商业用途,商用前请阅读其服务条款。
- 网络可达性。部分平台对特定地区有限制,注册前确认你的环境能否正常调用。
- 不要共享 Key。把自己的下游 Key 公开分享,可能被他人刷爆额度,甚至触发平台风控。
适用场景
- 个人开发与原型验证:需要快速试多个开源模型,但不想一开始就付费。
- 学习与研究:跑通 RAG、Agent、函数调用等流程,验证思路是否可行。
- 小型内部工具:调用量不大、对稳定性要求不高的内部脚本或助手。
- 成本敏感的多模型对比:想在同一套代码里横向比较不同模型的效果,又不想为每家单独充值。
如果你需要的是稳定、可商用、有 SLA 的调用,免费额度只能作为过渡,最终还是要转向付费方案或本地部署。