排行榜给不出足够的证据
最近几周的四项独立研究显示,语言模型的成绩表格看上去比数据本身所能支持的要确定得多。这个问题同样存在于借助人工智能开展的科研中。

排行榜是机器学习领域最常用的进展通报方式:一列模型,一列测试,位置越高表示越好。最近几项研究却在追问,一旦问起测量的稳定性,这样一张表究竟能说明多少问题。答案并不好看。
同一个回答,结构却不同
其中一项审计的作者考察了模型对提示结构的推断。他在五个家族的八个开源变体上重复测量,参数规模从 8 到 6750 亿个参数,关闭缓存,保留 293 个中间表示。被测量的现象本身就不稳定:相同的调用无法复现出相同的结构,节点集合的平均一致率在 0.39 到 0.96 之间波动,而在 72% 的情况下,一对提示与模型在整个集合上从未一致过。加入聚类自助法之后,只有排行榜的底部站得住:两个最不可复现的模型在 99% 和 86% 的重复中保持位置,中间四个在 27% 到 48%,最好的两个在 68%。这张表能可靠地指出最差的模型,却指不出最好的。两条同样合理的重复实验合并规则会改变八行中的四行,并把研究标题移动 7 个百分点。八个终点指标中有四个在测量后十周内被撤回。
选择与统计
第二项研究追问,一个已发布的优势背后可能藏着多少个未公开的模型变体。对于一个给定模型家族,作者推导出一条敏感性曲线,描述这类变体的最大数量与家族内部相关系数下界之间的函数关系。对 Open LLM Leaderboard 上 394 条关于相邻名次的说法所做的审计显示,其中 391 条在考虑选择效应之前就已经没有统计依据。
第三项研究审视的是从经典测验理论借来的模型评审可靠性指标。在评审的测量错误率固定在 4.72% 的情况下,KR-20 系数随题库重新设计的不同在 0.01 到 0.68 之间变化。依赖指数常被误当成分类概率,两者相差 0.25 到 0.43 个点。作者的结论指向公共层面:这不是对具体论文的评审,而是一个提醒,因为这些数字会继续流传,进入部署决策和披露文件。
问题在数据,不在算法
第四项审计涉及七个用于预测教育结果的公开数据集。三个通过了建模前的全部四项检查,另外四个要么在跨群体泛化测试中不合格,要么缺少进行这些测试所需的元数据。最尖锐的例子是:在 UCI Student 数据集上,R² 从随机划分的 0.242 降到分组划分的 -0.097,在 Higher Ed 数据集上从 0.041 降到 -8.79。提高模型复杂度并没有消除这一点。在脆弱的数据上,模型集成反而放大了不稳定性。
此外还有伦理与编辑层面的线索。在 ScienceNet 转载的《光明日报》文章中,五位研究者描述了人工智能如何进入整个研究流程:从生成想法,到处理数据,再到撰写论文。随之而来的是关于想法归属、结果被过度打磨,以及无法转嫁给工具的责任的问题。这里的共同点与排行榜相同:一个数字或一张表,替代不了检验程序。
资料来源
5- 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
- 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
- 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
- 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
- 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。