跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

Anthropic的IPO账本与苹果裁员:推理的真实代价

路透社看到的Anthropic招股书显示,2025年基础设施承诺高达5180亿美元,净亏损420亿美元;与此同时,苹果新任首席执行官因内存涨价而开始裁员。

人工智能与模型新闻王雅琴发布: 2026年9月29日4 分钟阅读资料来源 10
Anthropic的IPO账本与苹果裁员:推理的真实代价

两件事相隔不到一天发生,却从两端描述了同一种挤压。路透社看到的Anthropic招股书显示,公司未来数年要在云、算力和基础设施上承担5180亿美元的义务。彭博社周三报道,苹果在新任首席执行官John Ternus的带领下,正计划小规模裁员并取消部分项目。

路透社查阅的文件里写着Anthropic的数字。2025年营收增长12倍,接近46亿美元。按经营口径计算,公司亏损超过80亿美元。去年在算力和基础设施上花了73.3亿美元,是2024年的三倍,占126.5亿美元总运营支出的一半以上。截至12月31日,公司持有现金、现金等价物和短期投资202.8亿美元。

这笔亏损并不都是现金。

在接近420亿美元的净亏损中,约340亿美元是会计计提,对应的是可转换为Anthropic股份的融资估值上升,而不是经营中花掉的钱。去年两家客户贡献了近四分之一的营收。招股书也提醒,许多大客户并未签下长期合同。

内存才是那道硬约束

苹果的问题更平常,对购买AI硬件的人来说也更有参考价值。公司在7月底给出了谨慎的营收指引,原因是拿不到足够的内存芯片,而内存涨价又压低了利润率。在最后一次财报电话会上,时任首席执行官Tim Cook形容这是「内存定价的百年一遇洪水,价格呈指数级上涨」。雅虎财经报道称,如果短缺持续,Ternus希望在2027年避免价格进一步上涨。

短缺有原因:高带宽内存和先进DRAM的训练与推理需求。雅虎财经指出,SK海力士、三星电子和美光在2026年大部分时间里已基本售罄高端AI内存产能,英伟达、微软、亚马逊和Meta都在争抢。供应商预计供应紧张会延续到2027年。

所以,跑一个模型的成本不只是软件问题,还是内存分配问题。苹果正在用人员编制为此买单。

一个token到底花多少钱

Artificial Analysis用自己的指数测了Anthropic的Claude Sonnet 5.5,结果模型拿到56分,比最高努力档的Opus 5.5低两分,而标价与Sonnet 5相同:每百万输入token 2美元,每百万输出token 10美元。问题在token用量。在最高努力档下,该模型每个Intelligence Index任务消耗约193000个输出token,是该公司测过的最高值,比最高档的Opus 5.5高出约60%,约为最高档GPT-6 Astra的七倍。每个任务成本接近7.60美元,比Sonnet 5高出约50%。

每token更便宜,并不自动等于每个任务更便宜,这也是路由本身成为一门手艺的原因。跑智能体工作负载的Unblocked描述了它如何把GLM 5.2流量在Baseten、Fireworks和CoreWeave之间切换,用一个自适应路由器按每次请求的实测成本和速度挑选供应商。在轮询模式下,Fireworks承担了51%的任务,价格比Baseten高25%。固定顺序则把Baseten推到98.5%。CoreWeave的标价比Baseten低约45%,但公司没有性能数据可用来安排它。

计费这一侧也有自己的算术。Flaviocopes算了一笔账:月销售额1万美元、每单50美元共200单的情况下,Stripe收350美元,Creem收470美元,Paddle收600美元,Gumroad收1450美元。作者说明Creem赞助了该网站,并表示所有费率都在9月29日对照各供应商的定价页面核对过。

硬件厂商在追同一条曲线

通用汽车的电池合资公司Ultium Cells周二表示,其田纳西州Spring Hill工厂将成为全球首个量产棱柱形LMR电芯的工厂。公司称这种电芯在成本相当的情况下能量密度比LFP高33%。升级从今年晚些时候开始,2028年完成,新增500个岗位,首款LMR车型预计2028年推出。

MaxLinear在网络上也提出了类似的成本理由。其9月29日发布的Puma 9 DOCSIS芯片支持DOCSIS 3.1、3.1+和4.0。公司称相比上一代可将用户端设备成本降低30%到50%,同时加入Wi-Fi 8支持和DDR5内存选项,因为DDR4供应正在收紧。基于该芯片的调制解调器预计2027年问世。

两条较小的工程记录指向同一个方向。Bitdrift发布了blob-stream,一个Kafka替代方案,设计目标是消除跨可用区网络流量和无状态broker,理由是跨可用区成本在云流处理账单中占大头。Radim Marek在Hetzner ccx33和GCE n2-standard-4上,把PostgreSQL 19的REPACK (CONCURRENTLY)与pg_repack和pg_squeeze做了基准对比。在同一张表上,在线重写产生18.8 GB WAL,而pg_repack产生33.5 GB。

这些都不会让推理变便宜。它们只是让账单变得看得懂,这是另一回事。

评论 0

资料来源

10
  1. 01Anthropic's IPO prospectus shows AI vision, surging costs: ReutersEN
  2. 02New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  3. 03Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  4. 04Routing LLM traffic across inference providers with TCP-style congestion controlEN
  5. 05What $10k a month in sales costs you on each payment providerEN
  6. 06GM's new EV battery tech will cut costs without sacrificing performance or rangeEN
  7. 07MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  8. 08Announcing blob-stream: a Kafka alternative for no fuss, low cost high volume streamingEN
  9. 09What REPACK (CONCURRENTLY) costs while it runsEN
  10. 10Anthropic IPO prospectus reveals surging costs, $42B 2025 net loss: reportEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。