模型追踪页面越来越多,发布日期和训练截止日期越差越远
9月16日上线的追踪页面列出8家实验室的20个现役模型,把模型出货那天和停止阅读那天并排放在一起。20个模型里,只有10个带着实验室真正公布过的训练截止日期。

页面 stale.jock.pl 给每个模型记两个日期。一个是发布日期,实验室出货的那天;另一个是训练截止日期,它停止阅读的那天。两个计数器都在实时往上跳。作者自己说得很直白:模型可以9月出货,却仍在4月停止阅读,等于发布当天就落后五个月。
清单写得很具体。Llama 4 于2025年4月5日发布,截止日期是2024年8月。Claude Haiku 4.5 于2025年10月15日发布,止于2025年7月。Gemini 3.1 Pro 于2026年2月19日发布,截止日期是2025年1月,落后十三个月。GPT-6 Astra 于2026年9月3日发布,止于2026年4月30日。GPT-6 Sol 于2026年9月22日发布,止于2026年4月20日;同一天发布的 GPT-6 Luna 止于2026年5月18日。Claude Opus 5.5 也在9月22日发布,止于2026年6月。
货架上有一半没公布截止日期
十个模型留空。八家实验室里,Anthropic、Google DeepMind、Meta、OpenAI 和 xAI 这五家至少有一个模型在页面上公布了截止日期。留空的包括页面上列出的整个 Mistral 系列(Large 3、Small 4、Medium 3.5)、阿里巴巴的 Qwen3.8-Max 和 Qwen3.8-Flash、Meta 的 Muse Glimmer 和 Muse Spark 1.3、DeepSeek V4-Pro 和 V4.1-Flash,以及 Gemini 3.8 Flash。页面对留空是什么意思很小心:核查过的厂商来源没能确定截止日期,这不等于实验室从未公布过。
作者还做了一次搜索测试:16个模型,超过2000次调用,每次调用都带一个网络搜索工具。页面说,前沿模型几乎每次都能判断正确。较弱的模型不经核查就说出已经变了的既定事实,还会为水的沸点这种事去搜网。同一次测试里,有五个模型把一位已故者说成挪威国王。
搜索还得由模型自己触发,用的是存着过时事实的同一批权重,所以失误正好落在模型最自信的地方。
这就是导出文件的理由。页面提供 models.json,每个模型带发布日期、公布的截止日期和一个来源链接,并建议把几行内容粘进智能体已经在读的 AGENTS.md 或 CLAUDE.md。指令是:在把任何模型、版本或日期说成当前之前,先取这个文件;任何带日期的内容,核查之前都算未经证实。文件随页面一起重新生成。
基准会变,日期不会
这不是唯一一个想管住模型事实的项目。另一个 Show HN 项目 Cactus Needle 3 于9月18日发布,面向微型设备推出8到29 MB的自动化模型,并声称一个4层子网络针对一个 epoch 调优后可以匹敌 DeepSeek V4 Flash。9月19日发布的 CUA-S1 是面向计算机使用的小型决策模型的早期仅源码研究版本,权重单独托管在 Hugging Face 上,源码采用 MIT 许可。
这些项目都没解决基准问题。追踪器告诉你模型何时停止阅读,不告诉你模型好不好。这个区别重要,因为发布公告和基准声明按不同的时钟到来,而截止日期是实验室不用争论方法论就能公布的一项元数据。
页面自己的建议是循环的,它也承认:直接问模型它的训练截止日期。行为良好的模型会回答,或者说自己不确定。一个编造出自信日期的模型,已经告诉了你关于它自己的有用信息。然后去核查答案,因为模型在模型问题上是个糟糕的来源。
资料来源
3- 01How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Needle 3 - 8-29 MB foundation model for tiny devicesEN
- 03trycua/cua: Scale computer-use 2.0EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。