Inférence auto-hébergée : l'écart de coût se creuse loin des API
Nexlab a comparé sept orchestrateurs d'inférence auto-hébergée en septembre 2026. Le moins cher ne fait aucun clustering. Les outils qui répartissent la charge sur plusieurs GPU viennent avec des réserves que leurs propres README annoncent.

L'étude, publiée par Nexlab le 20 septembre, compare LocalAI, exo, GPUStack, Xinference, Ollama, vLLM et CoderAI sur ce qui intéresse vraiment un acheteur : prise en charge de plusieurs machines, routage sensible au cache, débordement vers le cloud et entraînement. Les nombres d'étoiles viennent de l'API GitHub à la même date. Les cases de fonctionnalités sont tirées des README et de la documentation des projets. Quand l'auteur n'a pas pu confirmer un point, la case le signale au lieu de deviner.
Le classement ne ressemble pas à ce que promettrait un dossier d'achat. Ollama, 181 000 étoiles, est présenté comme la bonne réponse pour un portable ou un seul ordinateur de bureau, et rien de plus : une machine, un modèle à la fois, sans cluster au-delà du round-robin d'Open WebUI sur plusieurs URL Ollama. L'auteur invite quiconque a besoin de davantage à arrêter sa lecture à cet endroit. llamafile, de Mozilla, tient la même colonne : un exécutable unique pour Linux, macOS, Windows et les BSD, une seule machine par conception.
Les projets qui couvrent réellement plusieurs machines coûtent cher à exploiter. vLLM fait du parallélisme tensoriel et de pipeline via Ray, avec un cache de préfixes par instance, mais ne gère ni les modèles, ni les utilisateurs, ni le placement. llama.cpp, 129 000 étoiles, traverse les machines grâce à un rpc-server installé sur chacune et à un indicateur --rpc sur l'hôte. Ni l'un ni l'autre n'est un orchestrateur au sens où l'entend la plupart des acheteurs. Ce sont les briques que LocalAI, GPUStack, Xinference et CoderAI font tourner en dessous.
L'exception macOS et la lacune Linux
exo reçoit la recommandation la plus forte de l'article. Découverte sans configuration, partitionnement ring, pipeline et tensoriel proportionnel à la mémoire de chaque appareil, MLX en dessous, et RDMA sur Thunderbolt 5 sur les Mac récents. L'éditeur annonce un passage à l'échelle de 3,2x sur quatre appareils en parallélisme tensoriel. Mais en septembre 2026, exo reste limité au CPU sous Linux : le support NVIDIA et AMD est annoncé en cours de développement. Il sert des modèles de langue, la génération d'images restant derrière un indicateur de fonctionnalité. Le verdict de l'étude est net : si votre matériel est de l'Apple Silicon, rien d'autre n'approche ; sinon, exo n'est pas encore pour vous.
LocalAI est le plus large des choix polyvalents. Texte, image, vidéo, audio, embeddings et rerank, chaque backend étant un service gRPC dans sa propre image OCI, aucun GPU requis, des charts Helm, et depuis juin 2026 un vrai mode distribué. Un indicateur --p2p génère un jeton partagé, les instances se découvrent via libp2p et EdgeVPN, les requêtes sont fédérées vers le nœud le moins chargé, et un routeur v3 fondé sur NATS connaît la VRAM et les caches de préfixes. Les images de backend sont signées cosign. Ce qu'il ne fait pas : louer un GPU, répartir une requête non-LLM sur plusieurs machines, ou entraîner. Le débit brut en LLM reste en retrait d'une dizaine de pour cent par rapport à un moteur dédié, écrit l'auteur, parce que la généralité a un coût.
GPUStack et Xinference partagent la même conception superviseur plus workers, avec consoles web. Les deux sont soutenus par des entreprises, et l'auteur les voit déployés en clusters en Asie. GPUStack, 5 700 étoiles, est le plus opérationnel : utilisateurs et rôles, clés API avec mesure de consommation, Prometheus et Grafana, récupération automatique des modèles en échec, journaux des workers Ray dans l'interface, et prise en charge de neuf fournisseurs d'accélérateurs dont Ascend, Hygon et MThreads. Xinference, 9 600 étoiles, ajoute un cache KV partagé entre les réplicas lorsqu'il exécute vLLM en backend.
Il se place devant une centaine de fournisseurs et vos propres points de terminaison avec clés, budgets et suivi des dépenses, et n'exécute jamais un modèle.
Cette phrase concerne LiteLLM, que l'étude dit souvent pris pour une solution d'auto-hébergement. Ce n'en est pas une. Il route entre points de terminaison et vers les clouds, et n'exécute aucun poids lui-même.
Les deux entrées les plus orientées production ne portent pas d'abord sur le coût. NVIDIA Dynamo, 8 100 étoiles, et llm-d, 4 600, font du prefill et du decode désagrégés avec routage sensible au KV, et tous deux exigent Kubernetes sur du matériel NVIDIA. SkyPilot et dstack, 10 600 et 2 300 étoiles, planifient vos tâches sur plusieurs clusters et peuvent déborder vers le cloud, ce qui est un problème différent de servir un modèle efficacement. CoderAI, nouveau et sans étoiles, est le projet de l'auteur lui-même, divulgué d'emblée. Il revendique un débordement cloud budgété par modèle ainsi que du LoRA distribué, avec des images signées cosign sous Linux CUDA et Vulkan.
Deux projets ne sont nommés que pour être écartés. Petals a reçu son dernier commit en 2024. Hugging Face TGI a été archivé en mars 2026. L'étude note aussi que la production-stack de vLLM est la seule option Kubernetes du tableau marquée comme prête pour la production parmi les moteurs eux-mêmes. Les images signées restent rares : LocalAI et CoderAI utilisent cosign, la plupart du domaine non.
Pour les équipes qui pèsent où va l'argent de l'inférence, l'étude n'offre pas de tableau de prix. Elle offre quelque chose de moins confortable : une carte des orchestrateurs qui peuvent réellement utiliser un second GPU, de ceux qui ne le peuvent pas, et de ceux qui vous le diront dans leur propre documentation.
Sources
1Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.