Claude Haiku 5.5 API 价格下调 90%,推理成本结构生变
Anthropic 于 10 月 8 日发布 Claude Haiku 5.5,将 token 价格削减最高达 90%,以应对高吞吐量推理任务。此举凸显市场分化:小型模型成本骤降,而硬件和内存费用持续上涨,迫使开发者在原始速度与总计算支出之间寻找平衡。

Anthropic 于 10 月 8 日发布了 Claude Haiku 5.5。这是该公司最快且最具性价比的小型模型。此次发布针对数据查询和客户服务等高吞吐量任务。
据 The Decoder 报道,该模型比其前代产品 Haiku 4.5 便宜约 75%。对于提示词长度在 10万 token 以内的请求,Anthropic 声称此类请求占前代 Haiku 请求量的 90% 左右,价格降幅最高可达 90%。输入 token 价格降至每百万 0.10 美元,此前为 1.00 美元。输出 token 价格从每百万 5.00 美元降至 0.50 美元。
降价之际,技术栈的其他部分却变得更加昂贵。微软 Windows 负责人 Pavan Davuluri 在 Inside Windows 播客中承认,内存成本上升正促使公司让 Windows 11 使用更少的 RAM。Davuluri 称内存是行业的“首要关注点”,并指出 OEM 厂商正将 8GB 内存笔记本电脑重新推向市场。据 Windows Latest 报道,微软已将“8GB 及以上内存优化”列为 2026 年余下时间的官方优先事项。
更低的单 token 价格并不意味着更低的总账单。Artificial Analysis 将 Haiku 5.5 评为小型模型类别的领导者,其智能指数得分为 43。然而,该平台指出其 token 消耗量显著更高。在最高努力级别下,Haiku 5.5 每个任务消耗约 162000 个输出 token,大约是 OpenAI GPT-6 Luna 所需的 5万 token 的三倍。
效率权衡
即使在可比的性能水平下,差距依然存在。在“高”努力设置下,Haiku 5.5 得分为 38,每个任务消耗约 55000 token,而 GPT-6 Luna 以约 5万 token 达到相同分数。从帕累托效率(性能与资源使用之比)来看,OpenAI 的模型表现更优。在 GPT-6 Luna 上,从“xhigh”提升到“max”努力级别仅增加 2 分,但 token 消耗量增加了 1.8 倍。
Anthropic 指出,Haiku 5.5 使用了更新的 tokenizer,每个任务消耗的 token 略多于前代产品。Opus 4.x 模型也发生了类似情况,仅因 tokenizer 变更,token 使用量就跳升了约 30%。实际节省可能比单 token 价格暗示的要小,这一细节使纯粹价格战的叙事变得复杂。
硬件与基础设施压力
虽然 API 提供商在价格上竞争,但支撑这些模型所需的物理基础设施仍是瓶颈。HPCwire 指出,AI 推理系统与传统 Web 服务的故障模式不同。平均延迟看似正常,但用户可能已因请求在队列中等待批次形成而感到不满。冷启动行为是另一问题;启动推理工作进程涉及下载模型、将权重加载到内存以及初始化加速器状态。Kubernetes 可能显示 Pod 正在运行,但这并不意味着系统已具备实际服务能力。
这种复杂性推动了对专用硬件和软件优化的需求。Magnitude 是一款于 9 月发布的开源推理引擎,声称通过为特定硬件优化内核,使开放模型的运行速度比 llama.cpp 快 2 倍。该工具在用户设备上编译和调优内核,针对 Apple Silicon、NVIDIA、AMD 或纯 CPU 环境。它旨在将每个代理的内存使用量减少 27%,在 RAM 成本攀升之际,这是一个关键因素。
位置同样重要。Data Center Knowledge 报道了堪萨斯城市中心拟建的一座 20 层数据中心,旨在利用密集的运营商连接以实现低延迟推理。Revitalization Unlimited 创始人 Steve Austin 认为,推理必须在用户附近进行,因为延迟至关重要。该项目面临更高的建设成本,估计为 18300万 美元,约合每平方英尺 1300 美元,高于郊区设施。这种溢价仅对金融交易或实时 AI 交互等特定工作负载而言才是合理的。
监管机构对定价做法的审查也在加强。FTC 于 10 月 5 日向 24 家大型医疗服务公司发出信函,警告其避免欺骗性定价。虽然这与 AI 无直接关系,但此举显示了政府对价格透明度的更广泛兴趣。类似地,麦当劳于 10 月 2 日因据称使用 AI 工具确定特许经营定价而遭到起诉,原告声称此举通过促进算法价格固定违反了反垄断法。
更广泛的市场背景
追求更廉价推理的不仅是 Anthropic。arXiv 上的研究人员正在发表关于缓解推理时过度依赖和高效策略评估的论文。一篇于 10 月 7 日提交的论文提出了一种仅基于样本的框架,用于评估 Best-of-N 策略,有助于选择最有效的采样预算,而无需完全访问似然函数。这些学术工作为让推理更便宜、更可靠的工程努力提供了基础。
云提供商也在调整策略。据报道,AWS 在 9 月底将 GPU 容量价格提高了 15%,这与 Anthropic 的 API 降价形成对比。这种分歧表明,虽然原始计算成本正在上升,但应用层的竞争迫使提供商在其他地方寻找效率。结果是,智能的成本正在与驱动它的硅片成本解耦。
对于开发者而言,结论很明确:最便宜的 token 并不总是最具成本效益的解决方案。总拥有成本现在取决于 token 效率、硬件利用率以及工作负载的具体延迟要求。随着推理成为 AI 的主要战场,焦点正从原始模型能力转向交付经济性。
资料来源
9- 01Claude Haiku 5.5 arrives with massive price cutsEN
- 02Rising cost of memory, Microsoft explains why Windows 11 will use less RAMEN
- 03Why AI Inference Infrastructure Fails Differently From Traditional ServicesEN
- 04Launch HN: Magnitude (YC S25) – Self-optimizing inference engineEN
- 05Vertical Data Centers Face Cost-Proximity Trade-OffsEN
- 06FTC Issues Letters Warning Hospitals Against Deceptive Pricing PracticesEN
- 07McDonald’s sued for allegedly using AI tool to determine pricingEN
- 08Efficient Best-of-N policy evaluation for inference-time alignmentEN
- 09Understanding and Mitigating Inference-Time Overreliance Using Agentic MemoryEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。