模型有两个日期,第二个才说明它到底有多新
一个追踪页面记录了八家实验室共20个模型的发布日期和训练截止日期。其中10个模型,实验室没有公布训练截止日期。

这个页面叫“How stale is your AI?”,9月16日出现在Hacker News上。它给八家实验室的20个模型各记两个日期:发布日期和训练截止日期。每个日期都实时往上计数。计数器要JavaScript,日期不用。
这个区分比听起来更重要。发布日期是实验室把模型交付出去的日期,也是发布报道会写的日期。训练截止日期是模型停止阅读的日期。一个模型可以在9月发布,却早在4月就停止阅读,那么它在发布当天就已经落后五个月。
看GPT-6 Astra,OpenAI在2026年9月3日发布,截止日期是2026年4月30日。再看Claude Opus 5.5,2026年9月22日发布,截止日期是2026年6月。追踪页面的数据里,Meta的Llama 4是2025年4月5日发布,截止日期为2024年8月;Google DeepMind的Gemini 3.1 Pro是2026年2月19日发布,截止日期为2025年1月。
20个模型里有10个带着实验室真正公布的截止日期。八家实验室里有五家至少为一个模型公布了截止日期:Anthropic、Google DeepMind、Meta、OpenAI和xAI。空白项的意思是,查过的厂商来源没有确认该模型的截止日期。页面说,这不能证明实验室从未公布过。
为什么搜索解决不了这个问题
搜索工具只是把缺口盖住。页面认为,它们从来不会把缺口补上,因为搜索是模型自己发起的,用的还是那套装着过期事实的权重。模型搜索时读几页,只用在那一个回答里,然后就忘了。开一个新对话,它又回到4月。
网站用一个测试来支持这个说法:16个模型、超过2000次调用,每次都给一个网页搜索工具。页面说,前沿模型几乎每次都判断正确。较弱的模型则把已经改变的既定事实直接说出来,不去核实,还会上网搜水的沸点这类东西。
I gave 16 AI models a search button and asked who the king of Norway is. Five named a dead man.
页面还指出第二个更难测试的问题:模型不是关于模型的好来源。问一个模型它自己的训练截止日期。表现好的模型会回答,或者说自己不确定。一个编出一个自信日期的模型,刚刚已经告诉了你一些关于它自己的有用信息。
智能体读着自己的过期事实
页面提供一个机器可读的导出文件models.json,为20个模型各列出发布日期、已公布的截止日期和来源链接。它还提供可以直接粘贴到AGENTS.md或CLAUDE.md里的措辞,让智能体在把任何模型、版本或日期称为当前信息之前先抓取这份导出文件。理由很简单:智能体对模型的了解停在它自己的截止日期,而错误答案听起来照样自信。
这些数据不是关于哪个模型最好的最终结论。它只是核查一个说法,即时效性,而基准测试和发布文章很少谈到这一点。页面说,导出文件会随页面一起重新生成,所以智能体读到的是今天的日期,而不是烧进它权重里的日期。
有两个需要注意的地方。页面上有10个模型没有已公布的截止日期,所以单靠这个来源无法衡量它们的过时程度。搜索测试是作者自己做的,规模有多大,页面没有按模型细分。把它当作一个信号,而不是排行榜。
页面真正确立的是一种习惯:在把模型的知识当作当前信息引用之前,先找到它停止阅读的日期。发布日期不会告诉你这一点。
资料来源
1本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。