banner
约 2,400 字
8 分钟

告别Token焦虑,全网免费大模型API资源汇总

摘要

汇总全球范围内合规的免费及试用大模型 API 资源,来源为 GitHub 开源项目 free-llm-api-resources。文章整理了 OpenRouter、Google AI Studio、NVIDIA NIM、Groq、Cerebras、Mistral、Cohere、Cloudflare、GitHub Models 等常用免费平台的限额与模型,以及 Fireworks、Baseten、Modal、阿里云国际等提供试用积分的平台,并提醒不要滥用以免服务失效。

前言

随着 AI 快速发展,无论开发者还是一般用户,都能找到各种实用的 AI 项目。而这些项目要跑起来,稳定的大模型 API 就成了必备条件——你想在本地接个聊天机器人、做个翻译工具、或者让脚本自动生成文案,背后都得有一个 API 在供能。

虽然现在 Token 已经很便宜了,但免费的它不香吗? GitHub 上有个开源项目 free-llm-api-resources,专门整理全球范围内合规的官方免费及试用 API 资源,只收录正规平台,并且把每家的 token 额度、支持模型都标得清清楚楚,省去了自己一家家去官网翻的功夫。这篇文章就基于它,把最常用、最值得关注的平台挑出来讲清楚。

不过在列清单之前,我想先把几个绕不开的概念讲明白。因为我发现很多人(包括我自己刚开始时)是拿着免费额度去用,用了几天发现"怎么突然不行了",其实是没看懂限额的计量方式——这才是这篇文章真正想帮你避开的坑。

先分清:免费额度的四种类型

看着都是"免费",但背后的模式完全不同,能撑多久、能不能长期用,差别很大:

类型

典型代表

特点

适合

永久免费小额度

OpenRouter、Groq、Cloudflare

不花钱、长期有效,但每天有硬上限

长期小流量、个人折腾

注册送试用额度

Fireworks、Baseten、Modal

一次性给一笔,用完就没了

短期密集测试

绑卡送大额度

Modal(绑卡后 30 美元/月)

额度更大,但需要绑支付方式

有真实使用量、能接受绑卡

活动期内免费

飞书妙搭 OpenClaw

平台限时活动,规则随时会变

尝鲜、活动期蹭一波

为什么这个分类重要:很多教程只告诉你"这家免费",却没说是哪种免费。如果你拿"活动期免费"当"永久免费"来做长期项目,活动一结束整个项目就断了。做长期工具只用第一类,其余三类都当"临时资源"看待。

第四类的完整玩法我写在 飞书妙搭一键部署 OpenClaw 那篇里——那是典型的"活动期免费",额度规则官方随时会调整,别当成长期方案。

读懂限额:RPM / RPD / TPM / TPD 差在哪

翻各家文档时你一定会看到这几个缩写,它们不是一回事:

缩写

含义

通俗解释

RPM

Requests Per Minute

每分钟能发几次请求

RPD

Requests Per Day

每天能发几次请求

TPM

Tokens Per Minute

每分钟能消耗多少 token

TPD

Tokens Per Day

每天能消耗多少 token

为什么这个区分很关键:假设一家给你"20 请求/分钟、50 请求/天",那意味着你一天最多也就 50 次对话。而另一家写"100 万 token/日",看着数字大,但如果你每次请求都塞了几万 token 的长文档,实际能发多少次完全是另一笔账。

所以选平台时,要按自己的使用形态来换算

  • 聊天机器人、翻译工具(短输入短输出)→ 看 RPD,请求次数就是你的天花板

  • 文档分析、长文摘要(长输入)→ 看 TPD,一次请求可能吃掉几万 token

  • 批量跑脚本 → 看 RPM,因为你会短时间密集发请求,最先撞上的就是每分钟上限

还有一类更特殊的计量:Cloudflare 用"神经元"(Neurons) 而不是 token。这是它自定义的计算单位,把不同模型的算力消耗折算成统一刻度。好处是跨模型可比,坏处是你没法用"大概要花多少 token"来估算——只能实际跑一跑看扣多少。这类平台适合"先跑起来、看着用"。

常用的免费 API 平台

下面这几个是口碑好、配额相对宽松、用的人多的,重点介绍。

OpenRouter

OpenRouter 是目前非常流行的大模型统一网关,一个 key 就能调用几十款主流模型,特别适合接在各类 AI 工具里做"模型自由切换"。

  1. 限制:

  • 20 请求/分钟

  • 50 请求/天(未充值状态)

  • 充值后:1000 请求/天

  1. 所有模型共享同一个配额(也就是你用的是总的请求次数,不按模型单独算)。

  2. 支持的免费模型很多,包括 Gemma 3、Hermes 3、Llama 3.2、Llama 3.3,以及所有以 free 结尾的 DeepSeek、Qwen、Gemma 4 等,加起来 50 多款,覆盖了绝大多数常用开源模型。

小技巧:OpenRouter 特别适合"先白嫖测试各种模型、再决定给哪个付费"的玩法,很多本地工具(如各类 Chat 前端)都原生支持填 OpenRouter key。

"共享配额"这条要理解到位:因为它不按模型分开算,所以你今天用 A 模型聊了 40 次,再切到 B 模型就只剩 10 次了。这不是 bug,是设计——它的定位就是"给你试模型用",不是生产环境。

另外,以 free 结尾的模型有个常见现象:高峰期会被限流。免费额度本质上是"别人付费容量的空闲余量",所以晚间高峰撞上 429 属正常,不是你配置错了,换个时段通常就好。

Google AI Studio

Google 的免费额度平台,适合体验 Gemini 系模型。

注意:在英国/瑞士/欧洲经济区/欧盟以外的地区使用数据时,这些数据会被用于训练目的。国内使用需要网络支持,或使用中转项目转发。

模型名称及使用限制(各家模型的每日请求数不同,可直接在平台查看):

Google AI Studio 模型限制

"数据会被用于训练"这句要单独拎出来强调:免费额度不是白给的,代价通常就是数据。所以不要拿免费额度处理公司内部文档、客户资料、带个人信息的文本。条款里写得很清楚,只是很多人跳过没看。

需要处理敏感内容的话,本地模型才是正解,我在 本地运行 Gemma 4 那篇里写过完整方案,数据不出本机。

NVIDIA NIM

NVIDIA 官方托管的模型推理服务,适合跑 NVIDIA 生态相关的模型。

需要验证电话号码。模型的使用通常受上下文窗口大小的限制。

限制:每分钟 40 次请求。模型列表可看:https://build.nvidia.com/models

NVIDIA NIM

其他常用平台(一表速览)

平台名称

核心限额

支持模型

Groq

Llama 3.1 8B:14400 次/日;Llama 3.3 70B:1000 次/日

Llama 3.1/3.3、Kimi K2、Whisper、Llama Guard

Cerebras

30 请求/分钟、100 万 token/日

GPT-OSS 120B、Qwen 3 235B、Llama 3.3 70B、Llama 4

Mistral

1 请求/秒、10 亿 token/月

Mistral 全系列开源与商用模型

Cohere

20 请求/分钟、1000 次请求/月

Command 系列、Aya 系列

Cloudflare

10000 神经元/日

Llama、Gemma、DeepSeek、Qwen 等近百款

GitHub Models

额度与 Copilot 订阅挂钩,免费额度很少

GPT-4o/5、DeepSeek R1、Llama、Mistral 等

其中 Groq 和 Cerebras 主打"推理速度极快",适合对响应速度敏感的场景;Mistral 的 10 亿 token/月额度在免费平台里属于相当大方的,可以放心折腾。

这张表里有个细节值得单独说:Groq 把不同模型的额度分开写了(Llama 3.1 8B 给 14400 次/日,Llama 3.3 70B 只给 1000 次/日)。这不是偏心,而是大模型单次推理成本更高——8B 和 70B 的算力消耗差了近十倍,平台自然不会给同一个额度。所以看到"这家额度好大"时,先确认它给的是哪个尺寸的模型。

Mistral 那 10 亿 token/月是目前见过最大方的,但它限 1 请求/秒。这个组合意味着它适合"少次大量"(比如定期做文档摘要),不适合"高频小请求"(比如聊天机器人的连续对话)。

提供试用积分的 API 平台

除了"免费永续"的,还有一批平台提供一次性试用积分,适合做测试或短期项目:

平台名称

免费试用额度

核心支持模型

Fireworks

1 美元额度

各种开源模型:https://fireworks.ai/models

Baseten

30 美元无门槛额度

所有受支持的模型均可(按计算时间付费):https://www.baseten.co/library/

Modal

基础 5 美元/月,绑支付后 30 美元/月

全平台支持模型(按计算时长计费)

AI21

10 美元额度(有效期 3 个月)

Jamba 全系列

Upstage

10 美元额度(有效期 3 个月)

Solar Pro/Mini 系列

NLP Cloud

15 美元无门槛额度

多款开源 LLM 模型

阿里云国际站 Model Studio

单模型 100 万 token

Qwen 全系列:https://www.alibabacloud.com/en/product/modelstudio

Scaleway

100 万免费 token

Llama、Gemma、DeepSeek、Qwen、Mistral

这类平台额度通常有时效性(比如 3 个月有效),更适合"某个阶段密集测试某个模型",不适合长期稳定调用。

用这类平台有个容易吃亏的地方:不少是按"计算时间"计费而不是按 token(Baseten、Modal 都是)。意思是模型在 GPU 上占用了多久就扣多久的钱——哪怕那段时间它只是在等你的网络传输。所以这类平台上跑大模型比跑小模型贵得多:同一个任务用 8B 可能几毛钱,用 70B 就是几块钱。短期测试先拿小模型把流程跑通,再换大模型,能省不少。

国内怎么选

上面多是海外平台,国内访问可能不稳定。这里补充两个更适合国内网络的选择:

  • 魔塔社区(ModelScope):阿里达摩院旗下,有很多国内可直接访问的模型 API 和体验。

  • 推理时代等国内聚合平台:也提供部分免费 API,网络友好度高。

具体以平台实时政策为准,注册时留意免费额度和到期规则。

国内平台的隐性好处是不需要额外的网络工具,延迟也低。对应的,计费与合规按国内政策走,商用前务必看清条款。

白嫖的正确姿势:三条红线

这几条比"哪家额度大"更值得记住:

1. 别用主账号。 免费额度的账号被限流、封禁的概率远高于付费账号,一旦被封,你用这个账号登录的其他服务也会被牵连。注册专用邮箱和账号来玩免费额度,是最省心的做法。

至于那些一次性用来收验证码的邮箱,我现在统一走 Agent Mail 这类给 AI 场景设计的临时邮箱——不占自己的常用邮箱、也不用一个个去申请,验证码直接读出来就能填。要一次注册十几家的免费额度时,这个顺手程度差别很大。

2. 别把免费额度当生产环境。 免费服务没有任何可用性承诺——平台随时可以调小额度、下架模型、或者直接停掉服务。你的自动化脚本如果跑在免费额度上,某天早上起来发现全挂了,是完全正常的。要长期跑的业务,必须准备付费方案做备份。

3. 别在一家薅到秃。 这条是项目作者写在开头的提醒,我认为也最重要:免费额度本质上是平台的营销成本,大家适度用,平台就愿意一直开着;如果被少数人拿脚本 24 小时刷满,平台最理性的选择就是直接砍掉免费额度——历史上已经有好几家这么干过。

一个更省事的思路:用网关把多家收拢

如果你手上已经攒了三五个平台的 key,会遇到一个新问题:每个 AI 应用都要分别配一遍,换了其中一个 key 还得一个个改回去。

解决办法是加一层网关——把各家 key 都填进网关,应用只连网关一个地址。想换模型、加供应商,在网关后台改就行,应用侧完全不用动。

我自己用过两个,定位不太一样:

  • 想简单能用FreeLLMAPI —— 界面友好、部署轻,自带免费模型获取链接,适合小白

  • 想管得细OmniRoute —— 内置 50 多家免费平台,其中有几家免鉴权(连注册都不用),适合玩得比较深的人

两者的取舍我在各自那篇里写得更细。

结尾

本文只节选了项目的一部分内容,完整清单(含更多平台、更新更及时的额度信息)建议访问项目地址:https://github.com/cheahjs/free-llm-api-resources 查看,并 Fork 仓库以跟进项目新增的资源和变化。

最后,借用项目作者写在开头的那句提醒:请不要滥用这些免费服务,白嫖一时爽,但要是大家都薅秃了,我们就可能永远失去这些免费额度了。

END