跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

模型追踪页面越来越多,发布日期和训练截止日期越差越远

9月16日上线的追踪页面列出8家实验室的20个现役模型,把模型出货那天和停止阅读那天并排放在一起。20个模型里,只有10个带着实验室真正公布过的训练截止日期。

人工智能与模型分析王雅琴发布: 2026年9月27日3 分钟阅读资料来源 3
模型追踪页面越来越多,发布日期和训练截止日期越差越远

页面 stale.jock.pl 给每个模型记两个日期。一个是发布日期,实验室出货的那天;另一个是训练截止日期,它停止阅读的那天。两个计数器都在实时往上跳。作者自己说得很直白:模型可以9月出货,却仍在4月停止阅读,等于发布当天就落后五个月。

清单写得很具体。Llama 4 于2025年4月5日发布,截止日期是2024年8月。Claude Haiku 4.5 于2025年10月15日发布,止于2025年7月。Gemini 3.1 Pro 于2026年2月19日发布,截止日期是2025年1月,落后十三个月。GPT-6 Astra 于2026年9月3日发布,止于2026年4月30日。GPT-6 Sol 于2026年9月22日发布,止于2026年4月20日;同一天发布的 GPT-6 Luna 止于2026年5月18日。Claude Opus 5.5 也在9月22日发布,止于2026年6月。

货架上有一半没公布截止日期

十个模型留空。八家实验室里,Anthropic、Google DeepMind、Meta、OpenAI 和 xAI 这五家至少有一个模型在页面上公布了截止日期。留空的包括页面上列出的整个 Mistral 系列(Large 3、Small 4、Medium 3.5)、阿里巴巴的 Qwen3.8-Max 和 Qwen3.8-Flash、Meta 的 Muse Glimmer 和 Muse Spark 1.3、DeepSeek V4-Pro 和 V4.1-Flash,以及 Gemini 3.8 Flash。页面对留空是什么意思很小心:核查过的厂商来源没能确定截止日期,这不等于实验室从未公布过。

作者还做了一次搜索测试:16个模型,超过2000次调用,每次调用都带一个网络搜索工具。页面说,前沿模型几乎每次都能判断正确。较弱的模型不经核查就说出已经变了的既定事实,还会为水的沸点这种事去搜网。同一次测试里,有五个模型把一位已故者说成挪威国王。

搜索还得由模型自己触发,用的是存着过时事实的同一批权重,所以失误正好落在模型最自信的地方。

这就是导出文件的理由。页面提供 models.json,每个模型带发布日期、公布的截止日期和一个来源链接,并建议把几行内容粘进智能体已经在读的 AGENTS.md 或 CLAUDE.md。指令是:在把任何模型、版本或日期说成当前之前,先取这个文件;任何带日期的内容,核查之前都算未经证实。文件随页面一起重新生成。

基准会变,日期不会

这不是唯一一个想管住模型事实的项目。另一个 Show HN 项目 Cactus Needle 3 于9月18日发布,面向微型设备推出8到29 MB的自动化模型,并声称一个4层子网络针对一个 epoch 调优后可以匹敌 DeepSeek V4 Flash。9月19日发布的 CUA-S1 是面向计算机使用的小型决策模型的早期仅源码研究版本,权重单独托管在 Hugging Face 上,源码采用 MIT 许可。

这些项目都没解决基准问题。追踪器告诉你模型何时停止阅读,不告诉你模型好不好。这个区别重要,因为发布公告和基准声明按不同的时钟到来,而截止日期是实验室不用争论方法论就能公布的一项元数据。

页面自己的建议是循环的,它也承认:直接问模型它的训练截止日期。行为良好的模型会回答,或者说自己不确定。一个编造出自信日期的模型,已经告诉了你关于它自己的有用信息。然后去核查答案,因为模型在模型问题上是个糟糕的来源。

评论 0

资料来源

3
  1. 01How stale is your AI? Release age and training cutoff for 20 modelsEN
  2. 02Needle 3 - 8-29 MB foundation model for tiny devicesEN
  3. 03trycua/cua: Scale computer-use 2.0EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。