告别Token焦虑,全网免费大模型API资源汇总
摘要
汇总全球范围内合规的免费及试用大模型 API 资源,来源为 GitHub 开源项目 free-llm-api-resources。文章整理了 OpenRouter、Google AI Studio、NVIDIA NIM、Groq、Cerebras、Mistral、Cohere、Cloudflare、GitHub Models 等常用免费平台的限额与模型,以及 Fireworks、Baseten、Modal、阿里云国际等提供试用积分的平台,并提醒不要滥用以免服务失效。
前言
随着 AI 快速发展,无论开发者还是一般用户,都能找到各种实用的 AI 项目。而这些项目要跑起来,稳定的大模型 API 就成了必备条件——你想在本地接个聊天机器人、做个翻译工具、或者让脚本自动生成文案,背后都得有一个 API 在供能。
虽然现在 Token 已经很便宜了,但免费的它不香吗? GitHub 上有个开源项目 free-llm-api-resources,专门整理全球范围内合规的官方免费及试用 API 资源,只收录正规平台,并且把每家的 token 额度、支持模型都标得清清楚楚,省去了自己一家家去官网翻的功夫。这篇文章就基于它,把最常用、最值得关注的平台挑出来讲清楚。
不过在列清单之前,我想先把几个绕不开的概念讲明白。因为我发现很多人(包括我自己刚开始时)是拿着免费额度去用,用了几天发现"怎么突然不行了",其实是没看懂限额的计量方式——这才是这篇文章真正想帮你避开的坑。
先分清:免费额度的四种类型
看着都是"免费",但背后的模式完全不同,能撑多久、能不能长期用,差别很大:
类型 | 典型代表 | 特点 | 适合 |
|---|---|---|---|
永久免费小额度 | OpenRouter、Groq、Cloudflare | 不花钱、长期有效,但每天有硬上限 | 长期小流量、个人折腾 |
注册送试用额度 | Fireworks、Baseten、Modal | 一次性给一笔,用完就没了 | 短期密集测试 |
绑卡送大额度 | Modal(绑卡后 30 美元/月) | 额度更大,但需要绑支付方式 | 有真实使用量、能接受绑卡 |
活动期内免费 | 飞书妙搭 OpenClaw | 平台限时活动,规则随时会变 | 尝鲜、活动期蹭一波 |
为什么这个分类重要:很多教程只告诉你"这家免费",却没说是哪种免费。如果你拿"活动期免费"当"永久免费"来做长期项目,活动一结束整个项目就断了。做长期工具只用第一类,其余三类都当"临时资源"看待。
第四类的完整玩法我写在 飞书妙搭一键部署 OpenClaw 那篇里——那是典型的"活动期免费",额度规则官方随时会调整,别当成长期方案。
读懂限额:RPM / RPD / TPM / TPD 差在哪
翻各家文档时你一定会看到这几个缩写,它们不是一回事:
缩写 | 含义 | 通俗解释 |
|---|---|---|
RPM | Requests Per Minute | 每分钟能发几次请求 |
RPD | Requests Per Day | 每天能发几次请求 |
TPM | Tokens Per Minute | 每分钟能消耗多少 token |
TPD | Tokens Per Day | 每天能消耗多少 token |
为什么这个区分很关键:假设一家给你"20 请求/分钟、50 请求/天",那意味着你一天最多也就 50 次对话。而另一家写"100 万 token/日",看着数字大,但如果你每次请求都塞了几万 token 的长文档,实际能发多少次完全是另一笔账。
所以选平台时,要按自己的使用形态来换算:
聊天机器人、翻译工具(短输入短输出)→ 看 RPD,请求次数就是你的天花板
文档分析、长文摘要(长输入)→ 看 TPD,一次请求可能吃掉几万 token
批量跑脚本 → 看 RPM,因为你会短时间密集发请求,最先撞上的就是每分钟上限
还有一类更特殊的计量:Cloudflare 用"神经元"(Neurons) 而不是 token。这是它自定义的计算单位,把不同模型的算力消耗折算成统一刻度。好处是跨模型可比,坏处是你没法用"大概要花多少 token"来估算——只能实际跑一跑看扣多少。这类平台适合"先跑起来、看着用"。
常用的免费 API 平台
下面这几个是口碑好、配额相对宽松、用的人多的,重点介绍。
OpenRouter
OpenRouter 是目前非常流行的大模型统一网关,一个 key 就能调用几十款主流模型,特别适合接在各类 AI 工具里做"模型自由切换"。
限制:
20 请求/分钟
50 请求/天(未充值状态)
充值后:1000 请求/天
所有模型共享同一个配额(也就是你用的是总的请求次数,不按模型单独算)。
支持的免费模型很多,包括 Gemma 3、Hermes 3、Llama 3.2、Llama 3.3,以及所有以
free结尾的 DeepSeek、Qwen、Gemma 4 等,加起来 50 多款,覆盖了绝大多数常用开源模型。
小技巧:OpenRouter 特别适合"先白嫖测试各种模型、再决定给哪个付费"的玩法,很多本地工具(如各类 Chat 前端)都原生支持填 OpenRouter key。
"共享配额"这条要理解到位:因为它不按模型分开算,所以你今天用 A 模型聊了 40 次,再切到 B 模型就只剩 10 次了。这不是 bug,是设计——它的定位就是"给你试模型用",不是生产环境。
另外,以 free 结尾的模型有个常见现象:高峰期会被限流。免费额度本质上是"别人付费容量的空闲余量",所以晚间高峰撞上 429 属正常,不是你配置错了,换个时段通常就好。
Google AI Studio
Google 的免费额度平台,适合体验 Gemini 系模型。
注意:在英国/瑞士/欧洲经济区/欧盟以外的地区使用数据时,这些数据会被用于训练目的。国内使用需要网络支持,或使用中转项目转发。
模型名称及使用限制(各家模型的每日请求数不同,可直接在平台查看):

"数据会被用于训练"这句要单独拎出来强调:免费额度不是白给的,代价通常就是数据。所以不要拿免费额度处理公司内部文档、客户资料、带个人信息的文本。条款里写得很清楚,只是很多人跳过没看。
需要处理敏感内容的话,本地模型才是正解,我在 本地运行 Gemma 4 那篇里写过完整方案,数据不出本机。
NVIDIA NIM
NVIDIA 官方托管的模型推理服务,适合跑 NVIDIA 生态相关的模型。
需要验证电话号码。模型的使用通常受上下文窗口大小的限制。
限制:每分钟 40 次请求。模型列表可看:https://build.nvidia.com/models

其他常用平台(一表速览)
平台名称 | 核心限额 | 支持模型 |
|---|---|---|
Groq | Llama 3.1 8B:14400 次/日;Llama 3.3 70B:1000 次/日 | Llama 3.1/3.3、Kimi K2、Whisper、Llama Guard |
Cerebras | 30 请求/分钟、100 万 token/日 | GPT-OSS 120B、Qwen 3 235B、Llama 3.3 70B、Llama 4 |
Mistral | 1 请求/秒、10 亿 token/月 | Mistral 全系列开源与商用模型 |
Cohere | 20 请求/分钟、1000 次请求/月 | Command 系列、Aya 系列 |
Cloudflare | 10000 神经元/日 | Llama、Gemma、DeepSeek、Qwen 等近百款 |
GitHub Models | 额度与 Copilot 订阅挂钩,免费额度很少 | GPT-4o/5、DeepSeek R1、Llama、Mistral 等 |
其中 Groq 和 Cerebras 主打"推理速度极快",适合对响应速度敏感的场景;Mistral 的 10 亿 token/月额度在免费平台里属于相当大方的,可以放心折腾。
这张表里有个细节值得单独说:Groq 把不同模型的额度分开写了(Llama 3.1 8B 给 14400 次/日,Llama 3.3 70B 只给 1000 次/日)。这不是偏心,而是大模型单次推理成本更高——8B 和 70B 的算力消耗差了近十倍,平台自然不会给同一个额度。所以看到"这家额度好大"时,先确认它给的是哪个尺寸的模型。
Mistral 那 10 亿 token/月是目前见过最大方的,但它限 1 请求/秒。这个组合意味着它适合"少次大量"(比如定期做文档摘要),不适合"高频小请求"(比如聊天机器人的连续对话)。
提供试用积分的 API 平台
除了"免费永续"的,还有一批平台提供一次性试用积分,适合做测试或短期项目:
平台名称 | 免费试用额度 | 核心支持模型 |
|---|---|---|
Fireworks | 1 美元额度 | 各种开源模型:https://fireworks.ai/models |
Baseten | 30 美元无门槛额度 | 所有受支持的模型均可(按计算时间付费):https://www.baseten.co/library/ |
Modal | 基础 5 美元/月,绑支付后 30 美元/月 | 全平台支持模型(按计算时长计费) |
AI21 | 10 美元额度(有效期 3 个月) | Jamba 全系列 |
Upstage | 10 美元额度(有效期 3 个月) | Solar Pro/Mini 系列 |
NLP Cloud | 15 美元无门槛额度 | 多款开源 LLM 模型 |
阿里云国际站 Model Studio | 单模型 100 万 token | Qwen 全系列:https://www.alibabacloud.com/en/product/modelstudio |
Scaleway | 100 万免费 token | Llama、Gemma、DeepSeek、Qwen、Mistral |
这类平台额度通常有时效性(比如 3 个月有效),更适合"某个阶段密集测试某个模型",不适合长期稳定调用。
用这类平台有个容易吃亏的地方:不少是按"计算时间"计费而不是按 token(Baseten、Modal 都是)。意思是模型在 GPU 上占用了多久就扣多久的钱——哪怕那段时间它只是在等你的网络传输。所以这类平台上跑大模型比跑小模型贵得多:同一个任务用 8B 可能几毛钱,用 70B 就是几块钱。短期测试先拿小模型把流程跑通,再换大模型,能省不少。
国内怎么选
上面多是海外平台,国内访问可能不稳定。这里补充两个更适合国内网络的选择:
魔塔社区(ModelScope):阿里达摩院旗下,有很多国内可直接访问的模型 API 和体验。
推理时代等国内聚合平台:也提供部分免费 API,网络友好度高。
具体以平台实时政策为准,注册时留意免费额度和到期规则。
国内平台的隐性好处是不需要额外的网络工具,延迟也低。对应的,计费与合规按国内政策走,商用前务必看清条款。
白嫖的正确姿势:三条红线
这几条比"哪家额度大"更值得记住:
1. 别用主账号。 免费额度的账号被限流、封禁的概率远高于付费账号,一旦被封,你用这个账号登录的其他服务也会被牵连。注册专用邮箱和账号来玩免费额度,是最省心的做法。
至于那些一次性用来收验证码的邮箱,我现在统一走 Agent Mail 这类给 AI 场景设计的临时邮箱——不占自己的常用邮箱、也不用一个个去申请,验证码直接读出来就能填。要一次注册十几家的免费额度时,这个顺手程度差别很大。
2. 别把免费额度当生产环境。 免费服务没有任何可用性承诺——平台随时可以调小额度、下架模型、或者直接停掉服务。你的自动化脚本如果跑在免费额度上,某天早上起来发现全挂了,是完全正常的。要长期跑的业务,必须准备付费方案做备份。
3. 别在一家薅到秃。 这条是项目作者写在开头的提醒,我认为也最重要:免费额度本质上是平台的营销成本,大家适度用,平台就愿意一直开着;如果被少数人拿脚本 24 小时刷满,平台最理性的选择就是直接砍掉免费额度——历史上已经有好几家这么干过。
一个更省事的思路:用网关把多家收拢
如果你手上已经攒了三五个平台的 key,会遇到一个新问题:每个 AI 应用都要分别配一遍,换了其中一个 key 还得一个个改回去。
解决办法是加一层网关——把各家 key 都填进网关,应用只连网关一个地址。想换模型、加供应商,在网关后台改就行,应用侧完全不用动。
我自己用过两个,定位不太一样:
想简单能用:FreeLLMAPI —— 界面友好、部署轻,自带免费模型获取链接,适合小白
想管得细:OmniRoute —— 内置 50 多家免费平台,其中有几家免鉴权(连注册都不用),适合玩得比较深的人
两者的取舍我在各自那篇里写得更细。
结尾
本文只节选了项目的一部分内容,完整清单(含更多平台、更新更及时的额度信息)建议访问项目地址:https://github.com/cheahjs/free-llm-api-resources 查看,并 Fork 仓库以跟进项目新增的资源和变化。
最后,借用项目作者写在开头的那句提醒:请不要滥用这些免费服务,白嫖一时爽,但要是大家都薅秃了,我们就可能永远失去这些免费额度了。