AI模型发布在加速,基准测试却跟不上
stale.jock.pl 追踪的 20 个现役模型中,有 10 个没有公布训练截止日期;9 月 14 日那一周,中国模型在 OpenRouter 上拿下了 57% 到 67% 的 token 份额。

据 stale.jock.pl 的模型追踪页面,2026 年 9 月 1 日至 9 月 22 日之间共有 6 个模型发布。该页面列出了 8 家实验室 20 个现役模型的发布日期和训练截止日期。仅 OpenAI 一家就在 9 月 22 日发了三个:GPT-6 Sol、GPT-6 Luna,以及 Anthropic 同日的 Claude Opus 5.5。这些信息来自该页面的表格和近期新闻标题。前沿 AI 模型的发布节奏现在以天计,不再以季度计。
但用来评判这些模型的工具没有跟上。训练截止日期,也就是模型停止阅读的日期,在这份名单上只有一半的模型公布了。追踪页面称,8 家实验室中有 5 家至少为一个模型公布了截止日期,分别是 Anthropic、Google DeepMind、Meta、OpenAI 和 xAI。空白条目意味着被核查的厂商来源没有确认截止日期,并不等于不存在。
发布与知情之间的落差
追踪页面自己的说法很直接:两个日期决定一个模型到底有多新。发布日期是实验室把它交出来的时间,训练截止日期是它停止阅读的时间。据该页面,2026 年 9 月 3 日发布的 GPT-6 Astra 截止日期为 2026 年 4 月 30 日,也就是说它在发布当天就已经落后了大约四个月。2026 年 9 月 1 日发布的 Claude Fable 5.1 截止日期是 2026 年 6 月。2026 年 2 月 19 日发布的 Gemini 3.1 Pro 在 2025 年 1 月就停止阅读,比它上市早了一年多。
一个模型可以在 9 月发布,却仍然在 4 月就停止阅读,这意味着它在上市那天已经落后五个月。
发布周期越压缩,这个落差越重要。据追踪页面,Mistral AI 于 2025 年 12 月 2 日发布 Mistral Large 3,2026 年 3 月 16 日发布 Mistral Small 4,2026 年 4 月 28 日发布 Mistral Medium 3.5,三者都没有公布截止日期。阿里巴巴的 Qwen3.8-Max(2026 年 8 月 3 日)、Qwen3.8-Flash(2026 年 8 月 26 日),以及 DeepSeek 的 V4-Pro(2026 年 8 月 13 日)和 V4.1-Flash(2026 年 9 月 10 日),同样被列为未公布截止日期。Meta 的 Muse Glimmer 和 Muse Spark 1.3,以及 Google DeepMind 的 Gemini 3.8 Flash 也是如此。
该页面认为,搜索工具补不上这个缺口。一个会联网搜索的模型读几页网页,在一次回答里用掉,然后忘掉;开一个新对话,它就回到自己的截止日期。更糟的是,搜索必须由模型自己触发,用的还是那套存着过时事实的权重,于是错误恰好落在模型最自信的地方。页面引用了一项测量,覆盖 16 个模型、超过 2000 次调用,每次都给模型一个网页搜索工具。前沿模型几乎每次判断都正确,较弱的模型则会说出已经改变的既定事实,还会为水的沸点这类东西去搜索网页。
使用量的变化比基准测试更快
实验室忙着发布的同时,使用数据讲的是另一个故事:开发者实际会去用哪些模型。据 CNBC 援引其获得的用量数据,2026 年中国 AI 模型在两个主要开发者平台上的份额从小比例变成了多数。在 OpenRouter 上,9 月 14 日那一周中国模型占到所用 token 的 57% 到 67%,而 2 月是 6% 到 13%。在 Vercel 上,它们的份额从 1 月的 11% 升到 8 月的 55%。
这种采用集中在 OpenRouter 定义的全球南方,即中南美洲、非洲和亚洲的 82 个国家。据 CNBC 报道,这些公司使用的 token 有超过三分之二流向中国模型。OpenRouter 上大约一半的 token 由美国公司使用。
据 CNBC 采访的人士说,价格是驱动力。OpenRouter 洞察负责人 Peter Walker 对该媒体表示,今年发布的中国开源模型“在高级智能体用例中确实能打,尤其是在编程方面,这在 2025 年底根本做不到”。他说,它们“相比美国实验室的大多数模型,性价比高得惊人”。Vercel 智能体基础设施负责人 Harpreet Arora 对 CNBC 表示,一旦模型达到某项工作的质量门槛,价格差就变得很有说服力,不过公司仍会为更复杂的任务选择美国的前沿模型。
据 CNBC 报道,本周早些时候 OpenAI 和 Anthropic 都发布了更便宜的新模型。Anthropic 研究实验室产品管理负责人 Dianne Penn 对该媒体表示,公司正努力让模型的回答“更高效,从而根据你的投入设置消耗更少 token”。
华盛顿在盯着 token 数
据 CNBC 报道,这一变化正在华盛顿引起审视,美国众议院两个委员会正在调查中国模型采用率上升的影响。美国已通过出口管制限制中国 AI 公司购买最先进的芯片;华盛顿担心它们通过海外数据中心远程使用 Nvidia 芯片,也担心“蒸馏”,即新模型模仿更早、更成熟的模型。
CNAS 技术与国家安全项目高级研究员 Daniel Remler 对 CNBC 表示,中国 AI 代表“美国面临真实的经济和安全风险”。他说:“最终的担忧是,中国 AI 模型的整合会把各国拉入一个中国技术势力范围,并固化为地缘政治上的站队。”Remler 还表示,东南亚尤其可能出现显著增长,“从拉各斯到圣保罗再到雅加达,凡是创业者和政府在寻找便宜、开放模型的地方,都会首先看向中国 AI”。
Nvidia 想用软件而不是芯片来改变这个算式。据 Rest of World 报道,Counterpoint Research 分析师 Marc Einstein 对该媒体表示,公司正在准备一个免费模型,预计名为 Nemotron 4,年底前推出,面向已经在运行 Nvidia 硬件的买家。据该媒体报道,没有哪个国家比阿联酋更符合这个描述,其旗舰数据中心将运行 40万 块 Nvidia 芯片。据 Rest of World 报道,Nvidia 还同意支付近 130亿 美元收购 Hugging Face,即开发者分享和下载模型的平台。
这笔支出的背景是:据 Rest of World 援引 Hugging Face 8 月的一份报告,更早版本的美国 AI 模型远远落后于中国的免费模型,后者今年下载量约为 20亿 次,远超任何西方对手。各国政府自建模型时,大多从 Meta 或阿里巴巴的免费模型起步。Einstein 说,Nvidia 的支出就是想让 Nemotron 成为它们改选的基础。
基准测试漏掉了什么
这些都没有解决根本的测量问题。一个模型的基准分数说明不了它是否知道截止日期之后发生了什么。stale.jock.pl 页面提出一个低技术含量的检查:直接问模型它的训练截止日期。该页面认为,规矩的模型会回答或说自己不确定;一个编造出自信日期的模型,已经告诉了你一些关于它自己的有用信息。页面还补充说,答案应当对照追踪页面核实,因为模型不是关于模型的好来源。
该页面还提供一个机器可读导出文件 models.json,包含全部 20 个模型的发布日期、已公布截止日期和来源链接,并建议通过智能体已经在读的 AGENTS.md 或 CLAUDE.md 指令文件把智能体指向它。该导出文件随页面一起重新生成,因此智能体读到的是今天的日期,而不是烤进它权重里的那些。
这只是权宜之计,不是解决办法。实验室控制着披露什么,而追踪页面上现役模型仍有一半没有公布截止日期。在这一点改变之前,只拿基准测试比较模型的人,评的是一张发布时就已经过期的快照。
资料来源
3- 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。