发布日期不是重点:训练截止日期与采用数据正在改写AI模型基准
stale.jock.pl上列出的20个当前AI模型中,有10个带有其所属实验室自己公布的训练截止日期;在OpenRouter上,中国模型在2026年2月占token的6%至13%,到9月14日那一周升至57%至67%。这两个数字都不出现在标准基准表里。

基准表告诉你一个模型考了多少分,却不会告诉你这个模型什么时候停止阅读。发布日期写在发布帖上,训练截止日期埋在模型卡里。两者之间的这段差距,如今是买家能查到的最有用的数字之一。9月16日,stale.jock.pl上发布了一个小工具,标题叫“你的AI有多旧?”,整件事就从这个前提出发。
该页面列出8个实验室的20个当前模型,把每个发布日期与一个训练截止日期配成一对,并从两个日期分别向上计数。20个里有10个带有实验室确实公布的截止日期。8个实验室中有5个,即Anthropic、Google DeepMind、Meta、OpenAI和xAI,至少为名单上的一个模型公布了截止日期。其余标记为“未确认”。页面谨慎地说明,这并不证明实验室从未公布过,只说明核对过的厂商来源没有找到。
有些差距很大。
OpenAI于2026年9月3日发布的GPT-6 Astra,训练截止日期是2026年4月30日。它在发货当天就已经落后了四个月。2026年2月19日发布的Gemini 3.1 Pro停在2025年1月,差距超过一年。2026年6月30日推出的Claude Sonnet 5,截止日期是2026年1月;2026年9月22日推出的Claude Opus 5.5,截止日期是2026年6月。Meta于2025年4月5日发布的Llama 4,截止日期是2024年8月。
该页面的核心论点是,搜索工具解决不了这个问题。网站说,模型上网搜索时只读几页,只为那一个答案用一下,然后就忘了。搜索还必须由模型自己触发,用的是那些装着过时事实的同一批权重,所以漏搜会集中在模型最自信的地方。作者报告说,他用网页搜索工具跑了16个模型、共2000次调用。前沿模型几乎每次都能正确决定去搜索,而较弱的模型在答案已经改变之后仍凭记忆回答已知问题,却会为水的沸点这类事情去上网搜索。有一个例子是,16个模型里有5个把一位已故的人说成挪威国王。
这些都没有经过同行评审。该页面是一个Show HN项目,数字来自作者自己的测试框架,模型名单是一个快照,而不是一次普查。但底层论点并不取决于这个实验是否站得住。一个9月发布、截止日期却停在4月的模型,对9月的判断就是错的,而基准分数不会把这一点显示给你。
同一周还有第二个更难忽视的信号,关乎人们实际在运行哪些模型。CNBC在9月26日报道,中国模型在两个开发者网关上从很小的使用份额升到多数。在OpenRouter上,它们占9月14日那一周token的57%至67%,高于2月的6%至13%。在Vercel上,其份额从1月的11%升至8月的55%。
OpenRouter的数字覆盖美国、欧洲以及它定义为“全球南方”的公司,即中美洲、南美洲、非洲和亚洲的82个国家。Vercel没有给出地域细分。同一报道指出,美国前沿模型仍吸引更多总支出,因此token份额和收入份额指向不同方向。
OpenRouter洞察负责人Peter Walker对CNBC说,今年发布的中国开源模型“在高级智能体用例中能有可信的表现,尤其是在编程方面,这在2025年底根本做不到”,而且它们“相比美国实验室的大多数模型极具成本效益”。Vercel智能体基础设施负责人Harpreet Arora把机制说得很直白:一旦模型达到某项工作的质量门槛,价格差异就变得很有说服力。
华盛顿在关注。美国众议院两个委员会正在调查中国模型采用率的上升。CNBC报道了对通过海外数据中心远程访问Nvidia芯片的担忧,以及对蒸馏的担忧,即较新的模型模仿较旧的模型。新美国安全中心的Daniel Remler对CNBC说,“最终的担忧是,中国AI模型的整合把各国拉进一个中国技术势力范围,并固化为地缘政治上的结盟”。
把这两件事放在一起,基准问题就变了形状。
排行榜衡量的是一个模型在受测当天面对一组固定任务的表现。它不衡量模型的知识离当下漂移了多远,也不衡量是否有人负担得起大规模运行它。stale.jock.pl页面主张,模型是自身情况的糟糕来源,并建议在让智能体说出任何模型、版本或日期为当前之前,先让它指向一个机器可读的models.json文件。这是个小修补。更大的问题是,行业的默认证据,也就是基准表,对新鲜度和价格都保持沉默。
据Rest of World报道,Nvidia在下相关的赌注。该公司上个月花了70亿美元,买下美国编程初创公司Poolside的股份以及其建模工具的许可,并已同意支付近130亿美元收购Hugging Face。它自己的免费模型预计名为Nemotron 4,将在年底前推出。报道说,早先的美国开放模型落后于中国的免费模型。根据8月的一份Hugging Face报告,后者今年下载量约为20亿次。Nvidia的支出意在让Nemotron成为各国政府选用的基础模型,而不是Meta或阿里巴巴的。
阿联酋是测试案例。其旗舰数据中心将运行在40万块Nvidia芯片上,国家支持的AI公司G42在7月加入了Nvidia的开放模型联盟。打造Falcon的技术创新研究院站在另一边。TII首席研究员Hakim Hacid对Rest of World说:“作为建模实验室,我们认为,保持AI视角的多样性、维护完整的技术主权,需要一个强大的本土基础。”
两种立场都无法由基准来裁定。一个国家或一家公司选择基础模型,就是选择一条供应链、一条成本曲线和一种更新节奏,而已公布的截止日期是其中少数几个关于更新节奏的硬数字之一。
资料来源
3- 01Show HN: How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。