AI正在吞噬科学:最新结果到底说明了什么
9月29日,美国国家经济研究局发布了一份工作论文,介绍一套开源工作流程:让一个大语言模型复现、改进并扩展已发表的经济学研究。在4452个复现包中,有3460个被标出存在差异。

这篇论文是国家经济研究局工作论文第35782号,标注日期为2026年9月,9月29日挂上该局网站。作者Matthew Schwartz、Isaiah Andrews和Jesse M. Shapiro说,这套流程先尝试复现一篇文章的原始计算,再检查结果与已发表结论之间的差异,然后运行自动化的敏感性分析。
他们从五本经济学刊物取来4452个已发表的复现包,在3460篇文章或其附录里标出了差异。这并不是说大多数经济学研究是错的,而是说自动重跑与印刷结果对不上的频率有多高。原因可能是代码笔误、版本不匹配,也可能是一个没有写进论文的选择。同一篇论文还给出另外两个数字。在496篇文章中,这套流程把某项计算的计算时间缩短了10倍以上,准确度相当或更高。在923篇文章中,它给出了原文没有的扩展,并且与原文的目标和假设一致。
论文自己写明的利益关系
在引用这些结果之前,有一段披露值得先读。这篇国家经济研究局的论文写明,文章的分析和写作过程中使用了LLM。Schwartz曾以合同工身份为Anthropic工作,论文声明其结果和观点未获Anthropic背书。Shapiro过去曾在微软新英格兰研究院担任有偿访问研究员,为FutureOfCapitalism担任有偿顾问,并因写作从《纽约时报》获得报酬。这比这一领域的大多数公告都要透明,而透明是双向的:读者可以据此权衡其中的利益冲突,而这些冲突是真实存在的。
数学家们在争论同一件事
9月29日发表的两篇文章从纯数学一侧切入这个问题。Dan Romik在博客中写道,在OpenAI宣布解决纳维-斯托克斯问题之后,数学家们对自己还剩下什么角色感到焦虑。他引用Scott Aaronson对此的反应,那是一串字母A,随后论证这种焦虑的解读是错的。
数学研究是一个反馈回路,它不断产生新知识:重新审视、消化和提炼已有知识,并试图加以改进,Romik写道。
他的技术性主张比标题式的说法要窄。在现有语料上训练的AI模型可以生成定理,用他的话说,这些定理与人类已生成的知识只差一步,而且生成速度比人快。他认为它们做不到的是反观这些产出、简化它、提取出一个证明为什么成立,并把其中的想法推广到可以复用。他预测,一个自主系统如果放任不管,会在第一波之后停滞,淹死在自己的产出里。Stephen Wolfram在9月28日写成、9月29日发表的一篇长文中提出了相关论点。他写道,现代AI首先是一种调用人类已有知识语料的方式,而纯数学的核心是人的想象力在决定该问什么问题。Wolfram还划出了AI与计算之间的界线。按他的说法,AI挖掘的是人类已经生产出来的东西。计算从一个规则出发运行它,产生的是不可归约的新结果,他把这一性质称为计算不可归约性。
产业层在同步推进
这些研究结果出现的同时,商业公告已经把自主研究当成一项产品功能。CoreWeave在9月29日发文介绍了ARIA,这是一个内置于Weights & Biases的编程智能体。它读取团队的实验,形成假设,写出配置并通过W&B Launch启动运行,然后把结果与基线比较并起草一份报告。
该公司说,ARIA生成的是可共享的W&B工作区、面板和报告,而不是返回文字,并且已在Weights & Biases移动应用中提供。页面顶部的一行说明显示,这篇文章最初于7月29日发表在W&B博客上,而CoreWeave自己的网站以9月的日期收录了它。甲骨文在9月29日也有类似动作,发布了Fusion Claw,一个用于其Fusion Applications的受治理智能体执行运行时。该公司说已有25个由Claw驱动的智能体应用可用,属于75个应用的组合的一部分,该运行时把前沿模型与企业级的确定性计算结合起来,并以Outcome Receipt作为可审计的运行记录。甲骨文的公告引用了公司CEO Mike Sicilia的话。新闻稿称,这些系统运行在甲骨文云基础设施上,由Gemini和OpenAI等前沿模型驱动,并计划支持其他模型。
硬件则从能耗一侧追赶同一个问题。Efficient Computer在9月29日说,它完成了由TQ Ventures领投的9700万美元B轮融资,累计融资额达到17300万美元,估值65000万美元。CEO Brandon Lucia写道,该公司的处理器能效比传统CPU架构高出10到100倍,并正在为嵌入式物理AI系统量产Electron E1。这一说法来自该公司自己的博客文章,本文未做独立核实。
能源、水,以及被要求接纳它的地方
算力建设有它的地理分布,而地理分布有它的政治。CBC新闻9月29日报道,纽芬兰与拉布拉多省能源部长Lloyd Parrott在9月中旬关于丘吉尔瀑布协议的特别会议上对议会说,本省的大门是敞开的。该部门发言人Brodie Thomas向CBC证实,政府已被企业就数据中心一事接洽,并称涉及商业敏感内容的讨论不便置评。CBC引用写过一本数据中心著作的Paris Marx的话,问他:在可能有更好用途的情况下,把这些电给数据中心是否合理。TechNL的CEO Andrea King对这家广播机构说,拉布拉多符合项目方看重的条件,低碳水电、寒冷天气和土地,但这本身并不能让一个项目变成好主意。
这场争论不只在加拿大。CBC指出,Meta计划在阿尔伯塔省斯特金县建设的数据中心预计耗资130亿美元,将在两到三年内上线,新斯科舍省省长Tim Houston则对任何项目方提出了五项先决条件。这一切背后的能源算术既老派又不时髦。David MacKay的Sustainable Energy Without the Hot Air网站最后修改日期是2015年8月29日,至今仍是信封背面的标准算法,这个页面在9月29日仍被翻出来。
更新的版本来自Hannah Ritchie,她9月29日在自己Substack上发了一篇关于电气化的分析。她梳理牛津大学教授Nick Eyre的数字后写道,转型完成后的全球终端能源需求从416艾焦降到247艾焦,低了约40%,而电力需求从110艾焦升到189艾焦。她写道,电动车把大约80%的能量转化为运动,汽油车只有20%。该模型假设所有未电气化的部门都使用氢能,她指出这是一个简化。
这一周到底确立了什么
这里没有任何东西表明AI已经取代了研究者。国家经济研究局那篇论文讲的是复现的工作流程,不是关于发现的断言。Romik的论证是预测,不是结果,他自己也明说他认为我们还没进入那个世界。Wolfram那篇是随笔。这一周真正确立的是:已发表成果的自动化复现与扩展工具如今已经公开存在,它们在大规模语料上的出错率高到值得在意,而搭建商业基础设施的人推销自主性的时间表,比思考自主性究竟为了什么的人短得多。
资料来源
9- 01An LLM Workflow That Reproduces, Improves, and Extends Published Economics ResearchEN
- 02The feedback loop of mathematics researchEN
- 03What's the Future for Pure Math Research in the Age of AI?EN
- 04Introducing CoreWeave ARIA: AI Research and Iteration AgentEN
- 05Oracle Extends Fusion Agentic Applications with Introduction of Fusion ClawEN
- 06Solving computing's energy problem with Efficient Computer's $97M Series BEN
- 07AI data centres in N.L.? The door is 'open for business,' says energy ministerEN
- 08Electrification efficiency: The world will need less energy after the transitionEN
- 09Sustainable energy without the hot airEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。