跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

自托管推理的成本差距最大,不在API定价

2026年9月,一项针对七款自托管推理编排工具的比较发现,最便宜的选择根本不支持集群,而能跨多块GPU的工具都带有厂商README里明说的限制。

人工智能与模型新闻王雅琴发布: 2026年9月27日4 分钟阅读资料来源 1
自托管推理的成本差距最大,不在API定价

这份调查由Nexlab于9月20日发布,把LocalAI、exo、GPUStack、Xinference、Ollama、vLLM和CoderAI放在买家真正关心的几项上对比:多机支持、缓存感知路由、云端突发和训练。星标数取自同一天的GitHub API,功能一栏来自项目自己的README和文档。作者无法确认的地方,表格里直接写明,不靠猜。

排名结果不是采购PPT会预测的那样。Ollama有181000颗星,被描述为笔记本或单台台式机的正确答案,仅此而已:一台机器,一次一个模型,除了用Open WebUI在多个Ollama地址之间轮询之外,没有集群方案。需要更多能力的人,被建议在文章那一处就停止阅读。Mozilla的llamafile属于同一栏,一个可执行文件覆盖Linux、macOS、Windows和BSD,按设计只支持单机。

真正能跨硬件的项目,运营成本也高。vLLM通过Ray实现张量和流水线并行,每个实例做前缀缓存,但不管理模型、用户或调度。llama.cpp有129000颗星,在每台机器上跑一个rpc-server,主机上带--rpc参数,从而跨机器运行。两者都不是多数买家所说的编排器。它们是LocalAI、GPUStack、Xinference和CoderAI底层运行的东西。

macOS的例外与Linux的缺口

exo在文中获得了最有力的单项推荐。零配置发现,ring、流水线和张量分区按每台设备的内存比例分配,底层是MLX,近年的Mac上还支持Thunderbolt 5上的RDMA。厂商自己给出的数字是四台设备做张量并行时达到3.2倍扩展。但截至2026年9月,exo在Linux上只支持CPU,NVIDIA和AMD支持标注为开发中,而且它只服务语言模型,图像生成藏在功能开关后面。调查的结论很直接:如果你的硬件是Apple Silicon,没有别的能接近它;如果不是,exo现在还不适合你。

LocalAI是通用选项中覆盖面最广的。文本、图像、视频、音频、嵌入和重排,每个后端都是独立OCI镜像里的gRPC服务,不需要GPU,有Helm chart,并且从2026年6月起有真正的分布式模式。--p2p参数会生成共享令牌,实例之间通过libp2p和EdgeVPN互相发现,请求会转发到负载最低的节点,基于NATS的v3路由器能感知VRAM和前缀缓存。后端镜像用cosign签名。它做不到的事:租GPU、把非LLM请求拆分到多台机器、训练。作者写道,原始LLM吞吐比专用引擎低几十个百分点,因为通用性是有代价的。

GPUStack和Xinference被归为带Web控制台的supervisor加worker设计,背后都有公司支持,也是作者在亚洲看到实际部署成集群的两款。GPUStack有5700颗星,更偏运维:用户和角色、带计量的API密钥、Prometheus和Grafana、失败模型自动恢复、UI里显示Ray worker日志,还支持九家加速器厂商,包括昇腾、海光和摩尔线程。Xinference有9600颗星,在后端运行vLLM时,增加了跨副本的共享KV缓存。

它站在一百家供应商和你自己的端点前面,管理密钥、预算和支出跟踪,自己从不运行模型。

这句话说的是LiteLLM,调查称它常被误认为是自托管方案。它并不是。它在端点之间以及到云之间做路由,自己不跑任何权重。

两个最强调生产环境的条目,主要关心的不是成本。NVIDIA Dynamo有8100颗星,llm-d有4600颗星,做的是分离式prefill和decode,配合KV感知路由,两者都要求NVIDIA硬件上的Kubernetes。SkyPilot和dstack分别有10600和2300颗星,把你的任务调度到多个集群,并且可以突发到云,这和高效服务一个模型是不同的问题。CoderAI很新,没有星标,是作者自己的项目,文章开头就披露了,声称支持按模型预算的云端突发和分布式LoRA,在Linux CUDA和Vulkan上有cosign签名的镜像。

有两个项目被点名只是为了排除。Petals最后一次提交是在2024年。Hugging Face TGI在2026年3月被归档。调查还指出,vLLM的production-stack是表里唯一被标为生产就绪的Kubernetes选项,而签名镜像很罕见:LocalAI和CoderAI用cosign,这个领域大多数项目不用。

对于正在权衡推理预算去向的团队,这份调查没有给出价格表。它给出的东西没那么舒服:一张图,说明哪些编排器真的能用上第二块GPU,哪些不能,以及哪些会在自己的文档里告诉你这一点。

评论 0

资料来源

1
  1. 01Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。