跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

发布日期不等于训练截止日期:20 个 AI 模型的知识有多旧

9 月 16 日上线的一个追踪页面显示,20 个当前 AI 模型里只有 10 个带有实验室真正公布的训练截止日期。发布日期和截止日期之间的差距,大多数发布报道从不提。

人工智能与模型分析王雅琴发布: 2026年9月27日3 分钟阅读资料来源 1
发布日期不等于训练截止日期:20 个 AI 模型的知识有多旧

stale.jock.pl 给每个模型记两个日期:实验室发布它的那一天,和它停止阅读世界的那一天。两个计数器都在实时往上走。决定模型到底知道什么的,是第二个日期。

OpenAI 在 2026 年 9 月 3 日发布 GPT-6 Astra,它的训练数据止于 2026 年 4 月 30 日。发布当天,这之后发生的事它已经落后了四个月。它还会继续落后,因为世界在变,权重里的东西不变。页面上整排模型都是这个模式。Meta 的 Llama 4 于 2025 年 4 月 5 日发布,截止日期是 2024 年 8 月;Anthropic 的 Claude Sonnet 5 于 2026 年 6 月 30 日发布,截止日期是 2026 年 1 月;GPT-6 Sol 于 2026 年 9 月 22 日发布,截止日期是 2026 年 4 月 20 日。网站称,页面上每个名称都链到日期所出自的实验室文档。

名单有一半是空的。

20 个模型里,10 个带有已公布的截止日期。另外 10 个没有,包括 Mistral Large 3、Qwen3.8-Max、DeepSeek V4-Pro 和 Muse Glimmer。页面说,原因是所核查的厂商资料没能确认一个。这不能证明实验室从未公布过,只能证明追踪者找不到。对想按新鲜度比较模型的人来说,这是另一个更尴尬的事实。

搜索补不上这个缺口

最明显的反驳是,模型现在会搜索网络,截止日期就没那么重要了。追踪页面的作者不接受。页面认为,搜索只为一个答案读几页,读完就忘,所以新一轮对话又从四月开始。更糟的是,搜索得由模型自己触发,用的还是那批装着过时事实的权重。漏掉的地方,恰好是模型听起来最确定的地方。页面引用了一项测试,覆盖 16 个模型、超过 2 000 次调用,每次都给一个网络搜索工具。前沿模型几乎每次判断都对。较弱的模型不查证就说出已经改变的事实,还会为水的沸点这类事情去搜索网络。其中一个例子里,五个模型把一个死人称作挪威国王。

这里埋着一个让人不舒服的方法论问题。页面说,被问到自己训练截止日期的模型不是好证人,因为一个编造出自信日期的模型,已经告诉了你关于它自己的有用信息。推荐的检查方式是外部的。

追踪页面以 models.json 的形式提供同样的数据,每个模型包含发布日期、公布的截止日期和一个来源链接。页面还建议把几行内容粘到智能体的 AGENTS.md 或 CLAUDE.md 里,让智能体在把任何模型或版本称为当前版本之前先取这个文件。文件随页面一起重新生成,所以智能体读到的是今天的日期,不是烤进自己权重里的日期。这份 20 个模型的名单横跨 8 家实验室,其中 5 家为页面上的至少一个模型公布了截止日期:Anthropic、Google DeepMind、Meta、OpenAI 和 xAI。

对关注基准测试的人来说,实际后果很简单。一个比较相隔数周发布的模型的排行榜,同时也在比较相隔数月训练的模型,而差距不在分数里。

评论 0

资料来源

1
  1. 01How stale is your AI? Release age and training cutoff for 20 modelsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。