自托管推理的成本差距最大,不在API定价
2026年9月,一项针对七款自托管推理编排工具的比较发现,最便宜的选择根本不支持集群,而能跨多块GPU的工具都带有厂商README里明说的限制。

这份调查由Nexlab于9月20日发布,把LocalAI、exo、GPUStack、Xinference、Ollama、vLLM和CoderAI放在买家真正关心的几项上对比:多机支持、缓存感知路由、云端突发和训练。星标数取自同一天的GitHub API,功能一栏来自项目自己的README和文档。作者无法确认的地方,表格里直接写明,不靠猜。
排名结果不是采购PPT会预测的那样。Ollama有181000颗星,被描述为笔记本或单台台式机的正确答案,仅此而已:一台机器,一次一个模型,除了用Open WebUI在多个Ollama地址之间轮询之外,没有集群方案。需要更多能力的人,被建议在文章那一处就停止阅读。Mozilla的llamafile属于同一栏,一个可执行文件覆盖Linux、macOS、Windows和BSD,按设计只支持单机。
真正能跨硬件的项目,运营成本也高。vLLM通过Ray实现张量和流水线并行,每个实例做前缀缓存,但不管理模型、用户或调度。llama.cpp有129000颗星,在每台机器上跑一个rpc-server,主机上带--rpc参数,从而跨机器运行。两者都不是多数买家所说的编排器。它们是LocalAI、GPUStack、Xinference和CoderAI底层运行的东西。
macOS的例外与Linux的缺口
exo在文中获得了最有力的单项推荐。零配置发现,ring、流水线和张量分区按每台设备的内存比例分配,底层是MLX,近年的Mac上还支持Thunderbolt 5上的RDMA。厂商自己给出的数字是四台设备做张量并行时达到3.2倍扩展。但截至2026年9月,exo在Linux上只支持CPU,NVIDIA和AMD支持标注为开发中,而且它只服务语言模型,图像生成藏在功能开关后面。调查的结论很直接:如果你的硬件是Apple Silicon,没有别的能接近它;如果不是,exo现在还不适合你。
LocalAI是通用选项中覆盖面最广的。文本、图像、视频、音频、嵌入和重排,每个后端都是独立OCI镜像里的gRPC服务,不需要GPU,有Helm chart,并且从2026年6月起有真正的分布式模式。--p2p参数会生成共享令牌,实例之间通过libp2p和EdgeVPN互相发现,请求会转发到负载最低的节点,基于NATS的v3路由器能感知VRAM和前缀缓存。后端镜像用cosign签名。它做不到的事:租GPU、把非LLM请求拆分到多台机器、训练。作者写道,原始LLM吞吐比专用引擎低几十个百分点,因为通用性是有代价的。
GPUStack和Xinference被归为带Web控制台的supervisor加worker设计,背后都有公司支持,也是作者在亚洲看到实际部署成集群的两款。GPUStack有5700颗星,更偏运维:用户和角色、带计量的API密钥、Prometheus和Grafana、失败模型自动恢复、UI里显示Ray worker日志,还支持九家加速器厂商,包括昇腾、海光和摩尔线程。Xinference有9600颗星,在后端运行vLLM时,增加了跨副本的共享KV缓存。
它站在一百家供应商和你自己的端点前面,管理密钥、预算和支出跟踪,自己从不运行模型。
这句话说的是LiteLLM,调查称它常被误认为是自托管方案。它并不是。它在端点之间以及到云之间做路由,自己不跑任何权重。
两个最强调生产环境的条目,主要关心的不是成本。NVIDIA Dynamo有8100颗星,llm-d有4600颗星,做的是分离式prefill和decode,配合KV感知路由,两者都要求NVIDIA硬件上的Kubernetes。SkyPilot和dstack分别有10600和2300颗星,把你的任务调度到多个集群,并且可以突发到云,这和高效服务一个模型是不同的问题。CoderAI很新,没有星标,是作者自己的项目,文章开头就披露了,声称支持按模型预算的云端突发和分布式LoRA,在Linux CUDA和Vulkan上有cosign签名的镜像。
有两个项目被点名只是为了排除。Petals最后一次提交是在2024年。Hugging Face TGI在2026年3月被归档。调查还指出,vLLM的production-stack是表里唯一被标为生产就绪的Kubernetes选项,而签名镜像很罕见:LocalAI和CoderAI用cosign,这个领域大多数项目不用。
对于正在权衡推理预算去向的团队,这份调查没有给出价格表。它给出的东西没那么舒服:一张图,说明哪些编排器真的能用上第二块GPU,哪些不能,以及哪些会在自己的文档里告诉你这一点。
资料来源
1本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。