推理成本向两端分化:开源引擎自我调优,芯片厂商削减硬件开销
一款于9月30日在GitHub发布的开源推理引擎宣称,通过在本机编译和调优内核,开放模型运行速度最高可达llama.cpp的2倍;与此同时,MaxLinear表示其新款Puma 9 DOCSIS芯片可将客户终端设备成本降低30%至50%。

Y Combinator S25孵化公司Magnitude于9月30日以Apache 2.0许可证发布了其代码库。该桌面应用会在模型运行前,针对Apple Silicon、NVIDIA、AMD或普通CPU调优内核。MaxLinear在9月29日的简报中声称,其Puma 9芯片相比2023年推出的前代产品Puma 8,可将调制解调器和网关成本降低30%至50%。
Magnitude的数据非常具体:README声称在Metal上解码速度比llama.cpp快92%,在CUDA上快19%;当智能体停止时,每个智能体释放27%的内存;并发会话间共享前缀缓存。它连接Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi和Cline,其他工具通过OpenAI兼容API处理。公司表示提示词、文件和模型保留在本地,模型下载后无需互联网。这是他们的卖点。但在你的硬件上是否成立则是另一回事:基准测试来自厂商自身,代码库未公布第三方复现结果。
MaxLinear的主张基于另一种调优。Puma 9支持DOCSIS 4.0、DOCSIS 3.1+和DOCSIS 3.1,增加Wi-Fi 8支持,并在Puma系列中首次采用ARM架构。MaxLinear通过2020年收购英特尔家庭网关平台业务继承了该系列。
一位熟悉该芯片的行业消息人士告诉Light Reading,转向ARM有助于降低功耗和部分授权成本。MaxLinear表示将继续支持x86产品,且RDK软件平台使底层CPU架构对客户基本透明。面对DDR4短缺,Puma 9也支持DDR5。MaxLinear网络基础设施和运营商业务单元高级副总裁兼总经理Puneet Sethi表示,公司认为DDR5生态系统、定价和供应将比DDR4所见的紧张局面更宽松。Dell'Oro Group的Jeff Heynen告诉Light Reading,由于板载内存应用和诊断可能需要的额外空间,大多数供应商将为更先进的Wi-Fi 8单元转向DDR5。
MaxLinear表示已有多项Puma 9承诺,点名Askey、Fritz! GmbH和Gemtek为CPE合作伙伴,并获得澳大利亚运营商NBN Co支持。基于该芯片的调制解调器和网关预计2027年推出。
成本压力不仅限于调制解调器。在医疗领域,Endpoints News在10月1日询问AI是否正在推高而非削减成本,背景是一波融资:Parakeet Health融资$10M用于自动化患者外联,Devoted Health融资$1.2B,两者均在10月1日报道。CleanTechnica在9月29日报道,Transport & Environment分析显示电动汽车每公里运行成本不足柴油车的一半,柴油车主每箱油比去年初多付€32,其中约€16是额外的炼油利润。同一媒体在9月28日报道数据中心运营商转向使用甲烷便携式发电机,以及世界卫生组织在2012年将柴油废气归类为致癌物后引发的旧柴油废气斗争。
硬件制造商也在试图从电池中剥离成本。Electrek在9月29日报道,Ultium Cells(GM与LG Energy Solution的合资企业)将在田纳西州Spring Hill量产棱柱形LMR电芯,声称在可比成本下能量密度比LFP高33%。GM副总裁Kurt Kelty表示增加LMR定位让公司能超越今天更实惠的化学体系。升级今年晚些时候开始,预计2028年完成,为1700人的团队增加500个职位;首款搭载LMR电池的电动汽车预计2028年推出。
运行更便宜,建设更昂贵
档案中的模式是推理和运营变得更便宜,而底层资产保持高昂。小鹏将四条产品线整合为两条以聚焦研发和削减成本,36Kr周一通过CnEVPost报道。该决定背后的数字:2026年前八个月交付量下降10.49%至243111辆,第二季度研发费用同比上升32.1%至291000万元,季度净亏损从一年前的48000万元扩大至134000万元。电信运营商也在走同样的路线。Light Reading在9月30日报道,StarHub和M1在新加坡进行合并谈判,据报道Singtel在6月持有43%的移动市场份额,M1为22%,StarHub为21%,Simba为14%。在新西兰,2degrees和OneNZ提议将他们的无线接入网络合并为一个共同拥有的实体,公平贸易委员会预计明年做出决定。中国电信和中国联通的5G安排,作为此类合作中最大的一项,覆盖150万基站,声称节省了560亿美元的资本支出。
研究也在侵蚀软件层面。一篇于9月29日提交至arXiv的论文《Demographic Pluralism》报告称,在GlobalOpinionQA和VITAL上的四个骨干网络上,相比Modular Pluralism,Jensen-Shannon距离降低了8.4%至26.4%,且无需意见分布训练数据或特定任务微调。第二篇被NeurIPS 2026接受的论文FluxLite报告称,在有限状态CTMC基准测试中,终端KL相比标准Feynman-Kac序贯蒙特卡洛基线最多提高两个数量级,在2D Ising采样中行相关MSE在几何平均值上降低5-7倍,峰值最高降低55倍。
微软研究院在9月23日认为,仅在机载GPU上运行物理AI推理会限制机器人性能、电池寿命和规模,而卸载到边缘或云GPU改善了移动操作工作负载中的任务成功率和运行时间。它还引入了基于Kubernetes的工具,以容器化和编排跨机器人、边缘和云的机器人工作负载。
一个注意事项贯穿所有内容。来自Magnitude、Ultium Cells和MaxLinear的性能数字是厂商自己的,而两篇arXiv论文的效率增益是在学术基准而非生产流量上测量的。
资料来源
11- 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 02MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
- 03Is AI jacking up healthcare costs?EN
- 04Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 05The Human Cost Of Data Center PollutionEN
- 06GM's new EV battery tech will cut costs without sacrificing rangeEN
- 07Xpeng reportedly consolidates product lines to cut R&D costsEN
- 08Singapore, New Zealand operators seek partnerships to cut costsEN
- 09Demographic Pluralism: Inference-Time Modeling of Pluralistic Human Preference DistributionsEN
- 10FluxLite: Inference-Time Proposal Control for Discrete Diffusion ModelsEN
- 11Offloaded inference for real-world physical AI roboticsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。