发布日期不等于训练截止日期:20 个 AI 模型的知识有多旧
9 月 16 日上线的一个追踪页面显示,20 个当前 AI 模型里只有 10 个带有实验室真正公布的训练截止日期。发布日期和截止日期之间的差距,大多数发布报道从不提。

stale.jock.pl 给每个模型记两个日期:实验室发布它的那一天,和它停止阅读世界的那一天。两个计数器都在实时往上走。决定模型到底知道什么的,是第二个日期。
OpenAI 在 2026 年 9 月 3 日发布 GPT-6 Astra,它的训练数据止于 2026 年 4 月 30 日。发布当天,这之后发生的事它已经落后了四个月。它还会继续落后,因为世界在变,权重里的东西不变。页面上整排模型都是这个模式。Meta 的 Llama 4 于 2025 年 4 月 5 日发布,截止日期是 2024 年 8 月;Anthropic 的 Claude Sonnet 5 于 2026 年 6 月 30 日发布,截止日期是 2026 年 1 月;GPT-6 Sol 于 2026 年 9 月 22 日发布,截止日期是 2026 年 4 月 20 日。网站称,页面上每个名称都链到日期所出自的实验室文档。
名单有一半是空的。
20 个模型里,10 个带有已公布的截止日期。另外 10 个没有,包括 Mistral Large 3、Qwen3.8-Max、DeepSeek V4-Pro 和 Muse Glimmer。页面说,原因是所核查的厂商资料没能确认一个。这不能证明实验室从未公布过,只能证明追踪者找不到。对想按新鲜度比较模型的人来说,这是另一个更尴尬的事实。
搜索补不上这个缺口
最明显的反驳是,模型现在会搜索网络,截止日期就没那么重要了。追踪页面的作者不接受。页面认为,搜索只为一个答案读几页,读完就忘,所以新一轮对话又从四月开始。更糟的是,搜索得由模型自己触发,用的还是那批装着过时事实的权重。漏掉的地方,恰好是模型听起来最确定的地方。页面引用了一项测试,覆盖 16 个模型、超过 2 000 次调用,每次都给一个网络搜索工具。前沿模型几乎每次判断都对。较弱的模型不查证就说出已经改变的事实,还会为水的沸点这类事情去搜索网络。其中一个例子里,五个模型把一个死人称作挪威国王。
这里埋着一个让人不舒服的方法论问题。页面说,被问到自己训练截止日期的模型不是好证人,因为一个编造出自信日期的模型,已经告诉了你关于它自己的有用信息。推荐的检查方式是外部的。
追踪页面以 models.json 的形式提供同样的数据,每个模型包含发布日期、公布的截止日期和一个来源链接。页面还建议把几行内容粘到智能体的 AGENTS.md 或 CLAUDE.md 里,让智能体在把任何模型或版本称为当前版本之前先取这个文件。文件随页面一起重新生成,所以智能体读到的是今天的日期,不是烤进自己权重里的日期。这份 20 个模型的名单横跨 8 家实验室,其中 5 家为页面上的至少一个模型公布了截止日期:Anthropic、Google DeepMind、Meta、OpenAI 和 xAI。
对关注基准测试的人来说,实际后果很简单。一个比较相隔数周发布的模型的排行榜,同时也在比较相隔数月训练的模型,而差距不在分数里。
资料来源
1本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。