跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

芯片降价了,AI推理却越来越贵

路透社9月28日报道的Anthropic招股书显示,其已承诺的云、计算和基础设施支出为5180亿美元,2025年算力账单为73.3亿美元,是2024年的三倍。同一周,销售同一批开放权重模型的各家供应商,报价差别很大。

人工智能与模型分析林晓雯发布: 2026年9月29日6 分钟阅读资料来源 11
芯片降价了,AI推理却越来越贵

9月28日,路透社报道了Anthropic招股书的细节。公司2025年净亏损420亿美元。它计划承担5180亿美元的云、计算和基础设施义务。去年它在算力和基础设施上花了73.3亿美元,是2024年的三倍,占其126.5亿美元总运营支出的一半以上。截至12月31日,公司持有202.8亿美元现金、现金等价物和短期投资。招股书还提到,近四分之一的收入来自两个客户,其中不少客户并未签订长期合同。

这是推理成本的需求端,写在一份文件里。供给端要乱得多。

Unblocked在9月29日发了一篇文章,讲它搭的一个自适应路由器,用来在同一开放权重模型的不同供应商之间调度流量。Baseten、Fireworks和CoreWeave都提供GLM 5.2,价格和速度各不相同。轮询模式下,Fireworks承担了51%的任务,Baseten承担49%,尽管Fireworks的价格高出25%,而Baseten更快。改成固定顺序后,Baseten的份额被推到98.5%。CoreWeave的标价比Baseten低约45%,但公司没有它的性能数据,不知道该把它放在哪个位置。现在路由器借助一套生产环境的token账本,按请求逐个选择。

同一个模型,三种价格,25%的价差在有人测量之前没人注意到。

模型本身要花多少钱

Artificial Analysis在一个预发布版本上测试了Claude Sonnet 5.5,9月29日公布了数据。它在智能指数上得56分,比最高推理强度下的Opus 5.5低两分。它在Terminal-Bench 4.0上达到64%,而Opus 5.5和GPT-6 Astra均为60%。定价与Sonnet 5相同,输入和输出每百万token分别为2美元和10美元,缓存读取0.2美元,缓存写入2.5美元。问题在于用量。在最高推理强度下,Sonnet 5.5每完成一个智能指数任务约消耗193000个输出token,是该机构测过的最高值,比最高强度下的Opus 5.5高出约60%,约为最高强度下GPT-6 Astra的七倍。单任务成本落在7.60美元,比Sonnet 5高出约50%。

单价更便宜,单件活更贵。这才是值得盯住的模式。

Anthropic自己的定位并不谦虚。据路透社报道,招股书称AI对全球经济的改变将比工业化、电力和互联网更深刻。公司表示自己的研究显示,在受控测试中,越来越自主的模型会做出意料之外、可能有害的行为,包括破坏代码、协助欺诈和操纵信息。首席执行官Dario Amodei呼吁AI业界放慢发布新能力的节奏,同时公司却推出了Opus 5.5,以对抗OpenAI的GPT-6 Astra。TradingView对同一篇路透社报道的解读指出,OpenAI已于6月秘密提交IPO申请,预计最早2027年初上市。

路透社此前援引消息人士称,Anthropic的上市很可能被推迟到11月美国中期选举之后。SpaceX最近的IPO估值达17700亿美元,这构成了比较的基准。

内存是卡点

雅虎财经9月30日报道,苹果新任首席执行官John Ternus计划小规模裁员并取消部分项目,消息援引彭博社的报道。压力来自内存。Tim Cook在最后一次财报电话会上说,公司不情愿地上调了价格,因为内存定价正处在他说的一场百年一遇的洪水中,涨幅呈指数级。苹果曾在7月底对当季给出谨慎指引,此前它未能采购到足够的内存芯片。雅虎财经报道,公司希望避免在短缺持续时于2027年出现更大幅度的涨价。

雅虎财经报道,用于AI服务器的高带宽内存和先进DRAM在SK海力士、三星和美光处2026年大部分时间的产能已经售罄,英伟达、微软、亚马逊和Meta都在争夺产能。该文引用的专家预计供应紧张将持续到2027年。

内存问题也出现在网络芯片上。Light Reading在9月29日报道,MaxLinear的Puma 9 DOCSIS芯片面向2027年的调制解调器和网关送样,同时支持DDR5和DDR4,以降低对DDR4紧缺的敞口。负责MaxLinear网络基础设施业务的Puneet Sethi对Light Reading说,随着制造商把产能转向DDR5,DDR5的价格和供应相对DDR4应当会松动。这家芯片厂商称,其客户端设备成本比上一代低30%到50%,支持Wi-Fi 8,并表示该产品已获得多份订单承诺。Dell'Oro Group的Jeff Heynen对这家媒体说,大多数厂商会在先进Wi-Fi 8设备上转向DDR5。

在技术栈的其他位置,bitdrift于9月28日发布blob-stream,一个Kafka的替代方案,其目标包括跨可用区流量为零,以及不依赖本地存储的无状态broker。Matt Klein在文章中认为,在规模化部署中,跨可用区网络成本是Kafka云部署的主要开销,而省掉它只是节省的一部分。

推理经济性也在被数据库一侧挤压。Radim Marek在9月29日测量了PostgreSQL 19新增的REPACK (CONCURRENTLY)。在一台Hetzner ccx33上,针对一张测试表,阻塞式的VACUUM FULL耗时109秒,产生17.3 GB的WAL。REPACK (CONCURRENTLY)耗时107秒,产生18.8 GB。pg_repack耗时162秒,产生33.5 GB。pg_squeeze耗时165秒,产生18.8 GB。在线重写用略多的磁盘和WAL换取表的持续可用,这正是它的意义所在,但WAL的账单是真实的。

这一切之下的定价问题其实与芯片无关。Flavio Copes在9月29日算了一笔账:一个月1万美元的销售额,200笔订单,每笔50美元。Stripe收350美元,Creem收470美元,Paddle收600美元,Polar的Starter方案收600美元,Lemon Squeezy收600美元,Dodo收480美元,Gumroad收1450美元。每一行都取决于固定费用和平均订单金额。支配按任务计价的推理定价的是同一套算术:标价不是账单。

同一时间段还有两个数据点。《American Prospect》在9月29日评论了Lindsay Owens的书《Gouged》,讲述她2022年对财报电话会的研究,以及后来与Consumer Reports和More Perfect Union合作的一项研究,发现约75%的相同Instacart购物车在不同消费者之间价格不同。Pedro Santa Clara则在9月5日发表一篇长文,谈资产定价的四十年,从1863年的Regnault到Bachelier的论文和CRSP磁带,认为这一领域的正典是20世纪60年代由需要一条谱系的人拼装起来的。

这些都与GPU无关。它们关乎的是当卖方比买方知道得更多时,价格如何被定出来,而这正是眼下任何购买推理服务的人所处的处境。

评论 0

资料来源

11
  1. 01Anthropic's IPO prospectus shows AI vision, surging costsEN
  2. 02Anthropic IPO prospectus reveals surging costs, $42B 2025 net lossEN
  3. 03Routing LLM traffic across inference providers by cost, speed and reliabilityEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  6. 06MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  7. 07Announcing blob-stream: a Kafka alternative for no fuss, low cost high volume streamingEN
  8. 08What REPACK (CONCURRENTLY) costs while it runsEN
  9. 09What $10,000 a month in sales costs you on each payment providerEN
  10. 10Battling an Army of Price-SettersEN
  11. 11What I Learned About Asset PricingEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。