Nicht die API-Preise, sondern selbst gehostete Inferenz reißt die größte Kostenschere auf
Ein Vergleich von sieben Orchestrierern für selbst gehostete Inferenz vom September 2026 zeigt: Die günstigste Option kann gar nicht clustern. Die Werkzeuge, die mehrere GPUs überspannen, haben Einschränkungen, die ihre Anbieter in den READMEs offen nennen.

Die Übersicht erschien am 20. September bei Nexlab. Sie stellt LocalAI, exo, GPUStack, Xinference, Ollama, vLLM und CoderAI in den Punkten gegenüber, die einen Käufer wirklich interessieren: Unterstützung mehrerer Maschinen, cachebewusstes Routing, Cloud-Burst und Training. Die Sternzahlen stammen von der GitHub-API am selben Tag, die Funktionsspalten aus den READMEs und der Dokumentation der Projekte. Wo der Autor etwas nicht bestätigen konnte, steht das in der Zelle, statt zu raten.
Die Rangfolge entspricht nicht dem, was eine Einkaufspräsentation erwarten ließe. Ollama mit 181.000 Sternen ist die richtige Antwort für einen Laptop oder einen Desktop, mehr nicht: eine Maschine, ein Modell zur Zeit. Cluster gibt es nur, indem Open WebUI mehrere Ollama-URLs reihum anspricht. Wer mehr braucht, solle an dieser Stelle aufhören zu lesen, heißt es im Artikel. Mozillas llamafile steht in derselben Spalte: eine einzelne ausführbare Datei für Linux, macOS, Windows und die BSDs, konstruktionsbedingt eine Maschine.
Die Projekte, die tatsächlich Hardware überspannen, sind die teuren im Betrieb. vLLM macht Tensor- und Pipeline-Parallelität über Ray und Prefix-Caching pro Instanz, verwaltet aber keine Modelle, Nutzer oder Platzierungen. llama.cpp mit 129.000 Sternen reicht über Rechner hinweg, mit einem rpc-server auf jeder Maschine und einem --rpc-Flag auf dem Host. Keines von beiden ist ein Orchestrierer in dem Sinn, den die meisten Käufer meinen. Sie sind das, was LocalAI, GPUStack, Xinference und CoderAI darunter ausführen.
Die macOS-Ausnahme und die Linux-Lücke
exo bekommt die stärkste Einzelempfehlung des Textes. Zero-Config-Erkennung, Ring-, Pipeline- und Tensor-Aufteilung proportional zum Speicher jedes Geräts, MLX darunter, dazu RDMA über Thunderbolt 5 auf neueren Macs. Der Anbieter nennt 3,2-fache Skalierung auf vier Geräten für Tensor-Parallelität. Doch Stand September 2026 läuft exo unter Linux nur auf der CPU, NVIDIA- und AMD-Unterstützung gelten als in Entwicklung, und es bedient Sprachmodelle; Bildgenerierung steckt hinter einem Feature-Flag. Das Urteil der Übersicht ist deutlich: Ist die Hardware Apple Silicon, kommt nichts anderes heran. Ist sie es nicht, ist exo noch nichts für Sie.
LocalAI ist die breiteste der Allzweckoptionen. Text, Bild, Video, Audio, Embeddings und Rerank, jedes Backend ein gRPC-Dienst im eigenen OCI-Image, keine GPU nötig, Helm-Charts, und seit Juni 2026 ein echter verteilter Modus. Ein --p2p-Flag erzeugt ein gemeinsames Token, Instanzen finden sich über libp2p und EdgeVPN, Anfragen gehen an den am wenigsten ausgelasteten Knoten, und ein NATS-basierter v3-Router kennt VRAM und Prefix-Caches. Backend-Images sind mit cosign signiert. Was LocalAI nicht tut: eine GPU mieten, eine Nicht-LLM-Anfrage über Maschinen aufteilen oder trainieren. Der rohe LLM-Durchsatz liegt um einige zehn Prozent unter dem einer dedizierten Engine, schreibt der Autor, weil die Allgemeinheit ihren Preis hat.
GPUStack und Xinference fasst die Übersicht als Entwürfe aus Supervisor und Workern mit Web-Konsolen zusammen. Beide werden von Firmen getragen, und beide sieht der Autor in Asien als Cluster im Einsatz. GPUStack mit 5.700 Sternen ist das betriebsnähere: Nutzer und Rollen, API-Schlüssel mit Abrechnung, Prometheus und Grafana, automatische Wiederherstellung ausgefallener Modelle, Ray-Worker-Logs in der Oberfläche und Unterstützung für neun Beschleunigeranbieter, darunter Ascend, Hygon und MThreads. Xinference mit 9.600 Sternen ergänzt einen gemeinsamen KV-Cache über Replikate, wenn vLLM im Backend läuft.
Es sitzt vor hundert Anbietern und den eigenen Endpunkten, mit Schlüsseln, Budgets und Ausgabenverfolgung, und führt selbst nie ein Modell aus.
Diese Zeile handelt von LiteLLM. Die Übersicht hält fest, dass es oft fälschlich für eine Selbsthosting-Lösung gehalten wird. Das ist es nicht. Es leitet zwischen Endpunkten und zu Clouds weiter und führt selbst keine Gewichte aus.
Die beiden Einträge mit der stärksten Produktionsausrichtung drehen sich nicht in erster Linie um Kosten. NVIDIA Dynamo mit 8.100 Sternen und llm-d mit 4.600 betreiben disaggregiertes Prefill und Decode mit KV-bewusstem Routing, und beide verlangen Kubernetes auf NVIDIA-Hardware. SkyPilot und dstack mit 10.600 und 2.300 Sternen planen Ihre Jobs über Cluster hinweg und können in die Cloud ausweichen. Das ist ein anderes Problem als das effiziente Bedienen eines Modells. CoderAI, neu und ohne Sterne, ist das eigene Projekt des Autors, offen benannt, und verspricht modellbezogenen budgetierten Cloud-Burst plus verteiltes LoRA, mit cosign-signierten Images unter Linux CUDA und Vulkan.
Zwei Projekte werden nur genannt, um ausgeschlossen zu werden. Petals erhielt den letzten Commit 2024. Hugging Face TGI wurde im März 2026 archiviert. Die Übersicht merkt außerdem an, dass vLLMs production-stack die einzige Kubernetes-Option in der Tabelle ist, die unter den Engines selbst als produktionsreif markiert ist. Signierte Images sind selten: LocalAI und CoderAI nutzen cosign, der Großteil des Feldes nicht.
Für Teams, die abwägen, wohin das Geld für Inferenz fließt, bietet die Übersicht keine Preistabelle. Sie bietet etwas Unbequemeres: eine Karte, welche Orchestrierer eine zweite GPU tatsächlich nutzen können, welche nicht, und welche es einem in der eigenen Dokumentation sagen.
Quellen
1Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.