跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

两个日期决定AI模型有多旧,20家实验室只有10家两个都公布

9月16日上线的追踪页面列出了8家实验室20个当前模型的发布时间和训练数据截止时间,并从每个日期起实时往上计数。20个模型里只有10个带有实验室真正公布的截止时间。

人工智能与模型新闻林晓雯发布: 2026年9月27日3 分钟阅读资料来源 1
两个日期决定AI模型有多旧,20家实验室只有10家两个都公布

这个页面叫 stale.jock.pl,9月16日作为 Show HN 投稿出现。它的出发点很窄:一个模型可以在9月发布,但它可能早在4月就停止阅读了。所以在任何人敲下提示词之前,这道发布日期的落差就已经存在。同样的数据也以 models.json 的形式提供,供智能体抓取。

八家实验室里有五家至少为一个列出的模型公布了截止时间:Anthropic、Google DeepMind、Meta、OpenAI 和 xAI。页面上说,表格里的空白意味着所查的厂商来源没有确立截止时间,并不证明该实验室从未公布过。Mistral、Alibaba 和 DeepSeek 出现在表格中,所展示的模型没有确立的截止时间。

逐个模型看落差

OpenAI 的 GPT-6 Astra 于 2026 年 9 月 3 日发布,训练数据停在 2026 年 4 月 30 日,落差四个月。GPT-6 Sol 于 9 月 22 日发布,停在 4 月 20 日。GPT-6 Luna 发布日相同,停在 5 月 18 日。Anthropic 的 Claude Opus 5.5 于 9 月 22 日发布,截止时间为 2026 年 6 月;Claude Fable 5.1 于 9 月 1 日发布,同样是 2026 年 6 月。Meta 的 Llama 4 于 2025 年 4 月 5 日发布,截止时间为 2024 年 8 月。

表格里最长的滞后属于 Gemini 3.1 Pro:2026 年 2 月 19 日发布,截止时间为 2025 年 1 月,共十三个月。Mistral Large 3、Mistral Small 4、Mistral Medium 3.5、Qwen3.8-Max、Qwen3.8-Flash、Muse Glimmer、Muse Spark 1.3、DeepSeek V4-Pro 和 DeepSeek V4.1-Flash 都被列出,但没有公布截止时间,所以从这一来源无法为它们算出落差。

页面认为搜索工具解决不了这个问题。模型搜索时读几页,在一次回答里用掉,然后就忘了;开一个新对话,它又回到4月。搜索还必须由模型自己触发,用的还是那批存着过期事实的权重。网站声称做了一次测量,跨 16 个模型共 2000 多次调用,每次都给一个网页搜索工具。前沿模型几乎每次都能正确判断。较弱的模型则相反:答案已经改变,它们仍凭记忆回答已经定论的问题,却会为水的沸点去搜网页。页面还说,当 16 个模型被问到挪威国王是谁时,有五个说出了一个已经去世的人。

第二个数字为什么缺失

沉默背后有商业逻辑。发布日是营销事件,会有一篇发布帖。截止时间则是承认模型不知道什么。一家实验室一旦公布,就等于把在第一天衡量落差的方法交给了竞争对手和客户。结果是二十个里面十个。

页面给做智能体的人提了一个变通办法:在智能体本来就会读的 AGENTS.md 或 CLAUDE.md 文件里写上几行,告诉它在把任何模型、版本或日期当作当前信息之前先去抓取那份 JSON,并且在核对之前把所有带日期的内容都当作未经证实。导出的数据包含每个模型的发布日期、已公布的截止时间和一个来源链接,并随页面一起重新生成,所以智能体读到的是今天的日期,而不是它权重里的日期。这段文字就在页面上,可以直接粘贴。

明显的局限是,这个页面是一个模型对模型的叙述,它自己也这么说。它给出的核查单个模型的办法是直接问它训练截止时间是什么。表现好的模型会回答,或者说自己不确定。一个编造出自信日期的模型,已经告诉了你关于它自己的有用信息。在信任这个答案之前,先拿它跟表格核对。

页面上除了每个模型各一个的实验室文档链接之外,没有对这20个日期提供任何独立审计。任何要拿这些数字做发布决定的人,都应该点开那些链接,因为空白格正是最可能最先变动的。

评论 0

资料来源

1
  1. 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。