跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

新模型上线了,训练数据却停在几个月前

新鲜度追踪站stale.jock.pl列出20个现役AI模型,其中10个带有实验室真正公布的训练截止日期。有几个模型上线时,距离自己发布公告上的日期已经过去了好几个月。

人工智能与模型解释王雅琴发布: 2026年9月27日3 分钟阅读资料来源 1
新模型上线了,训练数据却停在几个月前

这个网站9月16日发在Hacker News上。它为每个模型记录两个日期:实验室发布的那天,和它停止阅读的那天。名单上有8家实验室的20个模型,浏览器里从每个日期开始实时往上计数。

差距本身就是故事。OpenAI在2026年9月3日发布的GPT-6 Astra,训练截止日期是2026年4月30日。同门的GPT-6 Sol在9月22日发布,截止日期是4月20日。同一天发布的GPT-6 Luna,截止日期是5月18日。Anthropic的Claude Opus 5.5在9月22日发布,停在2026年6月。6月30日上线的Claude Sonnet 5,1月就停止阅读了。

名单上有一半的模型,答案是未知。Mistral AI的Large 3、Small 4和Medium 3.5,阿里巴巴的Qwen3.8-Max和Qwen3.8-Flash,Meta的Muse Glimmer和Muse Spark 1.3,DeepSeek的V4-Pro和V4.1-Flash,以及Google DeepMind的Gemini 3.8 Flash,都没有给出已确定的截止日期。页面把话说得很谨慎:空白只说明所核查的厂商来源没能确认,并不证明实验室从未公布过。

为什么这个日期比版本号更重要

网站自己的说法很直白。一个模型可以在9月发布,却仍在4月停止阅读。还没等人往里面输入任何提示词,它在发布当天就已经落后五个月。

据页面所述,搜索工具解决不了这个问题。模型搜索时,会读几个页面,在一个回答里用掉它们,然后忘掉。开一个新对话,截止日期又回来了。决定要不要触发搜索的,还是那些装着过期事实的权重,所以漏判往往出现在模型最自信的地方。页面称它在16个模型上做了2000次调用测试,每次都给一个网页搜索工具。前沿模型几乎每次都判断正确。较弱的模型则会陈述已经改变的既定事实,还会为了水的沸点去搜网页。

我给16个AI模型一个搜索按钮,问它们挪威国王是谁。有五个说出了死人的名字。

这是网站自己的原话,也是这个问题最干净的例证。一个不知道君主已经去世的模型,不会可靠地决定去查一下。

这个变通办法是给智能体用的,不是给人用的

页面把同样的数据发布为models.json,每个模型带有发布日期、公布的截止日期和一条来源链接。它建议把一段简短指令粘进AGENTS.md或CLAUDE.md文件,让智能体在把任何模型称为最新之前先去获取它。

在实验室这一侧,公布的截止日期并不整齐。八家实验室中,Anthropic、Google DeepMind、Meta、OpenAI和xAI这五家,至少有一个模型在名单里给出了公布的截止日期。20个模型里有10个带有截止日期。其余的没有。

页面还提供了一个粗糙的自测方法:问模型它自己的训练截止日期。回答出来的,或者承认不确定的,表现正常。凭空编出一个自信日期的,已经告诉了你一些东西。网站的警告是,模型在关于模型的问题上是个糟糕的信息来源,所以要把答案对着表格核对,而不是直接相信它。

评论 0

资料来源

1
  1. 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。