记录于 2026-09-17。把 OpenRouter 上所有
:free模型逐个发真实请求跑了一遍,验证「到底能不能用」。所有结论都来自实测响应,不是看文档抄的。
一、结论速览#
444 个在架模型里,带 :free 后缀的 20 个,另外还有 4 个标价 0 的(两个音频生成、一个自动路由、一个隐身模型)。逐个实测(文本生成 + 工具调用)的结果:
| 类别 | 数量 |
|---|---|
| ✅ 真能聊、能调工具 | 13 |
| ⚙️ 能用,但不是聊天模型 | 1(安全分类器) |
| ❌ 用不了 | 6 |
🎁 非 :free 但 0 定价且能用 | 2 |
一句话::free 的 20 个里 13 个实测可用,剩下 7 个要么被上游限流、要么干脆不放行。
二、怎么把模型池筛出来#
curl -s https://openrouter.ai/api/v1/models > models.jsonimport json
d = json.load(open('models.json'))['data']
free = [m['id'] for m in d if m['id'].endswith(':free')] # 20 个
zero = [m['id'] for m in d if float(m['pricing']['prompt']) == 0
and float(m['pricing']['completion']) == 0] # 4 个两个坑要提前说:
openrouter/free不算:free。它是「免费模型自动路由」,按请求需要的能力去免费池里挑一个,不在后缀筛选里,很容易漏掉。标价字段不可信。我以前实测过标价
$0.0000014/M的模型实际按$2.98/M扣费,所以「0 定价」只能当线索、不能当结论——真要确认免费,得看响应里的实际用量。
三、测试方法#
每个模型发两个请求(都不带上下文):
文本:
Reply with exactly the word PONG on the first line, then on the second line the value of 17*23.—— 只要它真答出PONG/391,说明这条链路是通的。工具:给一个
get_weather函数定义,问「北京天气怎么样,请调用工具」,看响应里有没有tool_calls。
参数统一 max_tokens=1500、temperature=0。这里的 max_tokens 是个大坑,见第六节。
四、实测能用的 13 个#
| 模型 | 上下文 | 上游通道 | 备注 |
|---|---|---|---|
inclusionai/ling-3.0-flash-vl | 262K | Novita | 支持图片/视频输入,最快约 2s,工具调用通过 |
inclusionai/ling-3.0-flash-sante | 262K | Novita | 工具调用通过 |
inclusionai/ling-3.0-flash-fin | 262K | Novita | 首次撞 429,重试即通过 |
nex-agi/nex-n2.5-pro | 262K | Nex AGI | 工具调用通过,但慢(约 34s) |
nex-agi/nex-n2.5-mini | 262K | Nex AGI | 首次请求卡 250s 返回空响应,重试 1.4s 正常,抖动极大 |
cohere/north-mini-code | 256K | Cohere | 编码向,工具调用通过 |
nvidia/nemotron-3.5-lightning | 1M | Nvidia | 工具调用通过 |
nvidia/nemotron-3-super-120b-a12b | 262K | Nvidia | 工具调用通过 |
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning | 256K | Nvidia | 支持图/音/视频输入,工具调用通过 |
poolside/laguna-s-2.1 | 262K | Poolside | 文本通过;工具调用测试撞 429,未验证 |
poolside/laguna-xs-2.1 | 262K | Poolside | 同上 |
dots-studio/dots-3-note-preview | 512K | AtlasCloud | 工具调用通过 |
liquid/lfm-2.5-2.6b | 64K | Liquid | 只有 2.6B 的小模型,工具调用通过 |
工具调用这条是逐个实测的,13 个里 11 个明确通过(laguna-s / laguna-xs 因为撞限流没测到,不是不支持)。
五、另外两个 0 定价 + 一个特殊的#
| 模型 | 上下文 | 备注 |
|---|---|---|
stealth/union-alpha | 262K | 不挂 :free 但 0 定价,支持图片输入,文本和工具都稳,实测最好用 |
openrouter/free | 200K | 自动路由,实测被分到 Nex AGI / Novita,工具调用通过 |
nvidia/nemotron-3.5-content-safety | 128K | ⚠️ 不是聊天模型,是内容安全分类器;问它 17*23 它回的是 User Safety: safe |
openrouter/free 这条路子挺省事:不用挑模型,它自己按「你这请求要不要图像理解、要不要工具调用」去免费池里挑。代价是你不知道这次是谁答的(响应里 provider 字段会告诉你,但接入方往往不看)。
六、用不了的 6 个,分别卡在哪#
① 只给 agentic harness 开(403)
thinkingmachines/inkling:freethinkingmachines/inkling-small:free
报错原文:is only available on agentic harnesses. Try plugging it into a coding agent or productivity app listed on https://openrouter.ai/apps。
这两个模型上下文 1M、支持图/音输入,但是本地脚本直连 API 一律 403——它要求你挂在 OpenRouter 认证过的 agentic 应用里用。想裸调的同学可以死心了。
② 上游配置坏了(404)
nvidia/nemotron-3-ultra-550b-a55b:free
报错是 Function id '948fe171-...': Specified function in account '...' is not found——这是 Nvidia 自己那边的部署问题,重试也一样 404。550B 参数量的 MoE、1M 上下文,看着很香,但目前调不动。
③ 上游限流(429)
z-ai/glm-5.2:freegoogle/gemma-4-26b-a4b-it:freegoogle/gemma-4-31b-it:free
三个都是 temporarily rate-limited upstream。注意这是上游厂商在限流,不是 OpenRouter 在限你(响应里 metadata.provider_code 会区分这两件事)。免费池是共享的,热门模型被抢空很正常。两次测试都撞上,但换个时段可能就通了——这三个别当永久不可用。
七、踩到的两个坑#
坑 1:max_tokens 给小了会「假失败」#
第一轮我用 max_tokens=200 测,结果 6 个模型HTTP 200 但 content 是空字符串,看起来像坏了。
实际原因:这些模型几乎全是 reasoning 模型(会先输出思考过程),200 个 token 全被思考吃掉,正文一个都没轮到就截断了。响应里 completion_tokens_details.reasoning_tokens 会明说这件事——我当时看到 reasoning_tokens: 200 / completion_tokens: 200,也就是100% 花在思考上。
把 max_tokens 提到 1500 之后,这 6 个里 5 个立刻正常返回。所以判断一个模型能不能用,千万别用小 max_tokens 试,会冤枉一批好模型。
坑 2:先看剩余配额,再决定测多少#
免费模型有每日请求上限,我当时按全量模型 × 重试次数估了 130+ 次请求,跑到一半差点打爆当天配额,中途砍掉了脚本重写。
正确姿势是动手前先查一次(见下节),先算预算再发请求。
八、免费额度是按「账号」算的,不是按 key#
这是这次最有价值的一块。查配额:
curl -s https://openrouter.ai/api/v1/key -H "Authorization: Bearer $KEY" \
| jq '.data.free_model_daily_requests'
# { "used": 45, "limit": 50, "remaining": 5 }档位规则(看累计充值额,跟余额、跟已花多少无关):
| 累计充值(all time) | 免费模型请求/天 | 每分钟 |
|---|---|---|
| < $10 | 50 | 20 |
| ≥ $10(一次性,不过期) | 1000 | 20 |
一个细节:门槛有 1 美元容差。官方文档原话是「为吸收四舍五入和充值手续费,高档位从门槛下 1 美元开始给」——也就是累计充到 $9 就已经进 1000/天档了,不用真等到 $10。
为什么说是账号级不是 key 级:官方文档里,只对花费上限写了可以按键单独设置(Per-key credit limits),而免费模型的速率限制通篇只说 your account;官方博客的档位表格表头直接写 Account state,正文是 A free account gets 50 requests per day。对比它家 Data API 的文档——那里会明确写 30 requests/minute per key, 500 requests/day per account——说明 OpenRouter 想说「按键」的时候是会说清楚的。
严格讲,单个 key 无法从观测上彻底证伪「计数器存在 key 上」,但既然档位由账号累计充值决定、文档也只提 account,同一账号下新建 key 不会重置或叠加这 50 次。
一个反直觉的实测#
官方博客有一句 failed requests still count against your daily quota,但我的账对不上:
一共发出 54 次免费模型请求
其中 11 次被上游 429/404 拒绝
最后计数器停在 45
54 − 11 = 43,差 2 次大概是并发在途的。也就是说上游报错的请求似乎不计数,只有真正跑通的才扣。样本只有几十次、还带 ±2 误差,当参考,别当结论——真要精确控量,还是自己按次计数。
附带发现#
GET /api/v1/credits 文档写着 Management key required,但实测普通 inference key 也能调,能直接拿到累计充值和累计消耗:
{ "data": { "total_credits": 5, "total_usage": 3.819489125 } }不用专门建管理密钥。
九、值不值得用#
能省钱是真的:实测这些免费模型的响应里 cost 字段全是 0,确实不扣费。
但别当生产主通道:
429 太频繁,免费池是共享的,热门模型经常抢不到;
延迟抖动大——同一个模型从 1.4 秒到 250 秒都出现过;
可选模型结构偏中小(2.6B 到 120B),少数大 MoE 反而不稳定或干脆 404。
适合的三个场景:批量实验和一次性评测、给 agent 当降级/兜底通道、玩具和原型验证。
如果要长期用:花一次性 $10(实际 $9 就到)把免费额度提到 1000 次/天,是这里性价比最高的一步——比研究怎么绕限流靠谱得多。
讨论 0
还没有人说话。
登录登录后可以参与讨论