跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

推理成本向两端分化:开源引擎自我调优,芯片厂商削减硬件开销

一款于9月30日在GitHub发布的开源推理引擎宣称,通过在本机编译和调优内核,开放模型运行速度最高可达llama.cpp的2倍;与此同时,MaxLinear表示其新款Puma 9 DOCSIS芯片可将客户终端设备成本降低30%至50%。

人工智能与模型分析王雅琴发布: 2026年10月1日5 分钟阅读资料来源 11
推理成本向两端分化:开源引擎自我调优,芯片厂商削减硬件开销

Y Combinator S25孵化公司Magnitude于9月30日以Apache 2.0许可证发布了其代码库。该桌面应用会在模型运行前,针对Apple Silicon、NVIDIA、AMD或普通CPU调优内核。MaxLinear在9月29日的简报中声称,其Puma 9芯片相比2023年推出的前代产品Puma 8,可将调制解调器和网关成本降低30%至50%。

Magnitude的数据非常具体:README声称在Metal上解码速度比llama.cpp快92%,在CUDA上快19%;当智能体停止时,每个智能体释放27%的内存;并发会话间共享前缀缓存。它连接Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi和Cline,其他工具通过OpenAI兼容API处理。公司表示提示词、文件和模型保留在本地,模型下载后无需互联网。这是他们的卖点。但在你的硬件上是否成立则是另一回事:基准测试来自厂商自身,代码库未公布第三方复现结果。

MaxLinear的主张基于另一种调优。Puma 9支持DOCSIS 4.0、DOCSIS 3.1+和DOCSIS 3.1,增加Wi-Fi 8支持,并在Puma系列中首次采用ARM架构。MaxLinear通过2020年收购英特尔家庭网关平台业务继承了该系列。

一位熟悉该芯片的行业消息人士告诉Light Reading,转向ARM有助于降低功耗和部分授权成本。MaxLinear表示将继续支持x86产品,且RDK软件平台使底层CPU架构对客户基本透明。面对DDR4短缺,Puma 9也支持DDR5。MaxLinear网络基础设施和运营商业务单元高级副总裁兼总经理Puneet Sethi表示,公司认为DDR5生态系统、定价和供应将比DDR4所见的紧张局面更宽松。Dell'Oro Group的Jeff Heynen告诉Light Reading,由于板载内存应用和诊断可能需要的额外空间,大多数供应商将为更先进的Wi-Fi 8单元转向DDR5。

MaxLinear表示已有多项Puma 9承诺,点名Askey、Fritz! GmbH和Gemtek为CPE合作伙伴,并获得澳大利亚运营商NBN Co支持。基于该芯片的调制解调器和网关预计2027年推出。

成本压力不仅限于调制解调器。在医疗领域,Endpoints News在10月1日询问AI是否正在推高而非削减成本,背景是一波融资:Parakeet Health融资$10M用于自动化患者外联,Devoted Health融资$1.2B,两者均在10月1日报道。CleanTechnica在9月29日报道,Transport & Environment分析显示电动汽车每公里运行成本不足柴油车的一半,柴油车主每箱油比去年初多付€32,其中约€16是额外的炼油利润。同一媒体在9月28日报道数据中心运营商转向使用甲烷便携式发电机,以及世界卫生组织在2012年将柴油废气归类为致癌物后引发的旧柴油废气斗争。

硬件制造商也在试图从电池中剥离成本。Electrek在9月29日报道,Ultium Cells(GM与LG Energy Solution的合资企业)将在田纳西州Spring Hill量产棱柱形LMR电芯,声称在可比成本下能量密度比LFP高33%。GM副总裁Kurt Kelty表示增加LMR定位让公司能超越今天更实惠的化学体系。升级今年晚些时候开始,预计2028年完成,为1700人的团队增加500个职位;首款搭载LMR电池的电动汽车预计2028年推出。

运行更便宜,建设更昂贵

档案中的模式是推理和运营变得更便宜,而底层资产保持高昂。小鹏将四条产品线整合为两条以聚焦研发和削减成本,36Kr周一通过CnEVPost报道。该决定背后的数字:2026年前八个月交付量下降10.49%至243111辆,第二季度研发费用同比上升32.1%至291000万元,季度净亏损从一年前的48000万元扩大至134000万元。电信运营商也在走同样的路线。Light Reading在9月30日报道,StarHub和M1在新加坡进行合并谈判,据报道Singtel在6月持有43%的移动市场份额,M1为22%,StarHub为21%,Simba为14%。在新西兰,2degrees和OneNZ提议将他们的无线接入网络合并为一个共同拥有的实体,公平贸易委员会预计明年做出决定。中国电信和中国联通的5G安排,作为此类合作中最大的一项,覆盖150万基站,声称节省了560亿美元的资本支出。

研究也在侵蚀软件层面。一篇于9月29日提交至arXiv的论文《Demographic Pluralism》报告称,在GlobalOpinionQA和VITAL上的四个骨干网络上,相比Modular Pluralism,Jensen-Shannon距离降低了8.4%至26.4%,且无需意见分布训练数据或特定任务微调。第二篇被NeurIPS 2026接受的论文FluxLite报告称,在有限状态CTMC基准测试中,终端KL相比标准Feynman-Kac序贯蒙特卡洛基线最多提高两个数量级,在2D Ising采样中行相关MSE在几何平均值上降低5-7倍,峰值最高降低55倍。

微软研究院在9月23日认为,仅在机载GPU上运行物理AI推理会限制机器人性能、电池寿命和规模,而卸载到边缘或云GPU改善了移动操作工作负载中的任务成功率和运行时间。它还引入了基于Kubernetes的工具,以容器化和编排跨机器人、边缘和云的机器人工作负载。

一个注意事项贯穿所有内容。来自Magnitude、Ultium Cells和MaxLinear的性能数字是厂商自己的,而两篇arXiv论文的效率增益是在学术基准而非生产流量上测量的。

评论 0

资料来源

11
  1. 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  2. 02MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  3. 03Is AI jacking up healthcare costs?EN
  4. 04Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  5. 05The Human Cost Of Data Center PollutionEN
  6. 06GM's new EV battery tech will cut costs without sacrificing rangeEN
  7. 07Xpeng reportedly consolidates product lines to cut R&D costsEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09Demographic Pluralism: Inference-Time Modeling of Pluralistic Human Preference DistributionsEN
  10. 10FluxLite: Inference-Time Proposal Control for Discrete Diffusion ModelsEN
  11. 11Offloaded inference for real-world physical AI roboticsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。