跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

AI正在吞噬科学:最新结果到底说明了什么

9月29日,美国国家经济研究局发布了一份工作论文,介绍一套开源工作流程:让一个大语言模型复现、改进并扩展已发表的经济学研究。在4452个复现包中,有3460个被标出存在差异。

科学解释郑雪莉发布: 2026年9月29日7 分钟阅读资料来源 9
AI正在吞噬科学:最新结果到底说明了什么

这篇论文是国家经济研究局工作论文第35782号,标注日期为2026年9月,9月29日挂上该局网站。作者Matthew Schwartz、Isaiah Andrews和Jesse M. Shapiro说,这套流程先尝试复现一篇文章的原始计算,再检查结果与已发表结论之间的差异,然后运行自动化的敏感性分析。

他们从五本经济学刊物取来4452个已发表的复现包,在3460篇文章或其附录里标出了差异。这并不是说大多数经济学研究是错的,而是说自动重跑与印刷结果对不上的频率有多高。原因可能是代码笔误、版本不匹配,也可能是一个没有写进论文的选择。同一篇论文还给出另外两个数字。在496篇文章中,这套流程把某项计算的计算时间缩短了10倍以上,准确度相当或更高。在923篇文章中,它给出了原文没有的扩展,并且与原文的目标和假设一致。

论文自己写明的利益关系

在引用这些结果之前,有一段披露值得先读。这篇国家经济研究局的论文写明,文章的分析和写作过程中使用了LLM。Schwartz曾以合同工身份为Anthropic工作,论文声明其结果和观点未获Anthropic背书。Shapiro过去曾在微软新英格兰研究院担任有偿访问研究员,为FutureOfCapitalism担任有偿顾问,并因写作从《纽约时报》获得报酬。这比这一领域的大多数公告都要透明,而透明是双向的:读者可以据此权衡其中的利益冲突,而这些冲突是真实存在的。

数学家们在争论同一件事

9月29日发表的两篇文章从纯数学一侧切入这个问题。Dan Romik在博客中写道,在OpenAI宣布解决纳维-斯托克斯问题之后,数学家们对自己还剩下什么角色感到焦虑。他引用Scott Aaronson对此的反应,那是一串字母A,随后论证这种焦虑的解读是错的。

数学研究是一个反馈回路,它不断产生新知识:重新审视、消化和提炼已有知识,并试图加以改进,Romik写道。

他的技术性主张比标题式的说法要窄。在现有语料上训练的AI模型可以生成定理,用他的话说,这些定理与人类已生成的知识只差一步,而且生成速度比人快。他认为它们做不到的是反观这些产出、简化它、提取出一个证明为什么成立,并把其中的想法推广到可以复用。他预测,一个自主系统如果放任不管,会在第一波之后停滞,淹死在自己的产出里。Stephen Wolfram在9月28日写成、9月29日发表的一篇长文中提出了相关论点。他写道,现代AI首先是一种调用人类已有知识语料的方式,而纯数学的核心是人的想象力在决定该问什么问题。Wolfram还划出了AI与计算之间的界线。按他的说法,AI挖掘的是人类已经生产出来的东西。计算从一个规则出发运行它,产生的是不可归约的新结果,他把这一性质称为计算不可归约性。

产业层在同步推进

这些研究结果出现的同时,商业公告已经把自主研究当成一项产品功能。CoreWeave在9月29日发文介绍了ARIA,这是一个内置于Weights & Biases的编程智能体。它读取团队的实验,形成假设,写出配置并通过W&B Launch启动运行,然后把结果与基线比较并起草一份报告。

该公司说,ARIA生成的是可共享的W&B工作区、面板和报告,而不是返回文字,并且已在Weights & Biases移动应用中提供。页面顶部的一行说明显示,这篇文章最初于7月29日发表在W&B博客上,而CoreWeave自己的网站以9月的日期收录了它。甲骨文在9月29日也有类似动作,发布了Fusion Claw,一个用于其Fusion Applications的受治理智能体执行运行时。该公司说已有25个由Claw驱动的智能体应用可用,属于75个应用的组合的一部分,该运行时把前沿模型与企业级的确定性计算结合起来,并以Outcome Receipt作为可审计的运行记录。甲骨文的公告引用了公司CEO Mike Sicilia的话。新闻稿称,这些系统运行在甲骨文云基础设施上,由Gemini和OpenAI等前沿模型驱动,并计划支持其他模型。

硬件则从能耗一侧追赶同一个问题。Efficient Computer在9月29日说,它完成了由TQ Ventures领投的9700万美元B轮融资,累计融资额达到17300万美元,估值65000万美元。CEO Brandon Lucia写道,该公司的处理器能效比传统CPU架构高出10到100倍,并正在为嵌入式物理AI系统量产Electron E1。这一说法来自该公司自己的博客文章,本文未做独立核实。

能源、水,以及被要求接纳它的地方

算力建设有它的地理分布,而地理分布有它的政治。CBC新闻9月29日报道,纽芬兰与拉布拉多省能源部长Lloyd Parrott在9月中旬关于丘吉尔瀑布协议的特别会议上对议会说,本省的大门是敞开的。该部门发言人Brodie Thomas向CBC证实,政府已被企业就数据中心一事接洽,并称涉及商业敏感内容的讨论不便置评。CBC引用写过一本数据中心著作的Paris Marx的话,问他:在可能有更好用途的情况下,把这些电给数据中心是否合理。TechNL的CEO Andrea King对这家广播机构说,拉布拉多符合项目方看重的条件,低碳水电、寒冷天气和土地,但这本身并不能让一个项目变成好主意。

这场争论不只在加拿大。CBC指出,Meta计划在阿尔伯塔省斯特金县建设的数据中心预计耗资130亿美元,将在两到三年内上线,新斯科舍省省长Tim Houston则对任何项目方提出了五项先决条件。这一切背后的能源算术既老派又不时髦。David MacKay的Sustainable Energy Without the Hot Air网站最后修改日期是2015年8月29日,至今仍是信封背面的标准算法,这个页面在9月29日仍被翻出来。

更新的版本来自Hannah Ritchie,她9月29日在自己Substack上发了一篇关于电气化的分析。她梳理牛津大学教授Nick Eyre的数字后写道,转型完成后的全球终端能源需求从416艾焦降到247艾焦,低了约40%,而电力需求从110艾焦升到189艾焦。她写道,电动车把大约80%的能量转化为运动,汽油车只有20%。该模型假设所有未电气化的部门都使用氢能,她指出这是一个简化。

这一周到底确立了什么

这里没有任何东西表明AI已经取代了研究者。国家经济研究局那篇论文讲的是复现的工作流程,不是关于发现的断言。Romik的论证是预测,不是结果,他自己也明说他认为我们还没进入那个世界。Wolfram那篇是随笔。这一周真正确立的是:已发表成果的自动化复现与扩展工具如今已经公开存在,它们在大规模语料上的出错率高到值得在意,而搭建商业基础设施的人推销自主性的时间表,比思考自主性究竟为了什么的人短得多。

评论 0

资料来源

9
  1. 01An LLM Workflow That Reproduces, Improves, and Extends Published Economics ResearchEN
  2. 02The feedback loop of mathematics researchEN
  3. 03What's the Future for Pure Math Research in the Age of AI?EN
  4. 04Introducing CoreWeave ARIA: AI Research and Iteration AgentEN
  5. 05Oracle Extends Fusion Agentic Applications with Introduction of Fusion ClawEN
  6. 06Solving computing's energy problem with Efficient Computer's $97M Series BEN
  7. 07AI data centres in N.L.? The door is 'open for business,' says energy ministerEN
  8. 08Electrification efficiency: The world will need less energy after the transitionEN
  9. 09Sustainable energy without the hot airEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。