跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

排行榜给不出足够的证据

最近几周的四项独立研究显示,语言模型的成绩表格看上去比数据本身所能支持的要确定得多。这个问题同样存在于借助人工智能开展的科研中。

科学分析郑雪莉发布: 2026年9月25日8 分钟阅读资料来源 5
排行榜给不出足够的证据

排行榜是机器学习领域最常用的进展通报方式:一列模型,一列测试,位置越高表示越好。最近几项研究却在追问,一旦问起测量的稳定性,这样一张表究竟能说明多少问题。答案并不好看。

同一个回答,结构却不同

其中一项审计的作者考察了模型对提示结构的推断。他在五个家族的八个开源变体上重复测量,参数规模从 8 到 6750 亿个参数,关闭缓存,保留 293 个中间表示。被测量的现象本身就不稳定:相同的调用无法复现出相同的结构,节点集合的平均一致率在 0.39 到 0.96 之间波动,而在 72% 的情况下,一对提示与模型在整个集合上从未一致过。加入聚类自助法之后,只有排行榜的底部站得住:两个最不可复现的模型在 99% 和 86% 的重复中保持位置,中间四个在 27% 到 48%,最好的两个在 68%。这张表能可靠地指出最差的模型,却指不出最好的。两条同样合理的重复实验合并规则会改变八行中的四行,并把研究标题移动 7 个百分点。八个终点指标中有四个在测量后十周内被撤回。

选择与统计

第二项研究追问,一个已发布的优势背后可能藏着多少个未公开的模型变体。对于一个给定模型家族,作者推导出一条敏感性曲线,描述这类变体的最大数量与家族内部相关系数下界之间的函数关系。对 Open LLM Leaderboard 上 394 条关于相邻名次的说法所做的审计显示,其中 391 条在考虑选择效应之前就已经没有统计依据。

第三项研究审视的是从经典测验理论借来的模型评审可靠性指标。在评审的测量错误率固定在 4.72% 的情况下,KR-20 系数随题库重新设计的不同在 0.01 到 0.68 之间变化。依赖指数常被误当成分类概率,两者相差 0.25 到 0.43 个点。作者的结论指向公共层面:这不是对具体论文的评审,而是一个提醒,因为这些数字会继续流传,进入部署决策和披露文件。

问题在数据,不在算法

第四项审计涉及七个用于预测教育结果的公开数据集。三个通过了建模前的全部四项检查,另外四个要么在跨群体泛化测试中不合格,要么缺少进行这些测试所需的元数据。最尖锐的例子是:在 UCI Student 数据集上,R² 从随机划分的 0.242 降到分组划分的 -0.097,在 Higher Ed 数据集上从 0.041 降到 -8.79。提高模型复杂度并没有消除这一点。在脆弱的数据上,模型集成反而放大了不稳定性。

此外还有伦理与编辑层面的线索。在 ScienceNet 转载的《光明日报》文章中,五位研究者描述了人工智能如何进入整个研究流程:从生成想法,到处理数据,再到撰写论文。随之而来的是关于想法归属、结果被过度打磨,以及无法转嫁给工具的责任的问题。这里的共同点与排行榜相同:一个数字或一张表,替代不了检验程序。

评论 0

资料来源

5
  1. 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
  2. 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
  3. 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
  4. 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
  5. 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。