Koszt self-hostingu rozstrzyga się nie w cennikach API
Wrześniowe zestawienie z 2026 roku siedmiu orkiestratorów wnioskowania self-hosted pokazało, że najtańsza opcja nie oferuje żadnego klastrowania, a narzędzia obsługujące wiele kart GPU mają zastrzeżenia, których README producentów nie ukrywają.

Zestawienie opublikowane przez Nexlab 20 września porównuje LocalAI, exo, GPUStack, Xinference, Ollama, vLLM i CoderAI pod kątem tego, co naprawdę liczy się dla kupującego: obsługi wielu maszyn, routingu świadomego pamięci podręcznej, rozszerzania do chmury i treningu. Liczby gwiazdek pochodzą z API GitHuba z tego samego dnia, a informacje o funkcjach z README i dokumentacji samych projektów. Tam, gdzie autor nie mógł czegoś potwierdzić, pole mówi o tym wprost, zamiast zgadywać.
Ranking nie wygląda tak, jak przewidywałby to dział zakupów. Ollama, z 181 000 gwiazdek, jest opisana jako właściwy wybór na laptopa albo jeden komputer stacjonarny i nic więcej: jedna maszyna, jeden model naraz, bez historii klastrowej poza rozwinięciem kilku adresów Ollama przez Open WebUI. Kto potrzebuje więcej, temu autor radzi przerwać lekturę w tym miejscu. llamafile od Mozilli trafia do tej samej kolumny: pojedynczy plik wykonywalny dla Linuksa, macOS, Windows i systemów BSD, z założenia na jednej maszynie.
Projekty, które faktycznie obejmują wiele maszyn, są drogie w utrzymaniu. vLLM realizuje równoległość tensorową i potokową przez Ray oraz buforowanie prefiksów na instancję, ale nie zarządza modelami, użytkownikami ani rozmieszczeniem. llama.cpp, z 129 000 gwiazdek, sięga między maszynami przez rpc-server na każdym komputerze i flagę --rpc na hoście. Żaden z nich nie jest orkiestratorem w tym sensie, o jaki chodzi większości kupujących. To podłoże, na którym działają LocalAI, GPUStack, Xinference i CoderAI.
Wyjątek macOS i luka na Linuksie
exo dostaje w tekście najmocniejsze pojedyncze poparcie. Odkrywanie bez konfiguracji, partycjonowanie pierścieniowe, potokowe i tensorowe proporcjonalne do pamięci każdego urządzenia, pod spodem MLX, a na nowszych Macach RDMA po Thunderbolt 5. Liczba podana przez producenta to skalowanie 3,2 raza na czterech urządzeniach przy równoległości tensorowej. We wrześniu 2026 exo działa jednak na Linuksie tylko na procesorze, wsparcie dla NVIDIA i AMD jest w przygotowaniu, a obsługuje modele językowe, generowanie obrazów jest za flagą funkcji. Werdykt zestawienia jest ostry: jeśli masz sprzęt Apple Silicon, nic innego się nie zbliża; jeśli nie, exo jeszcze nie jest dla ciebie.
LocalAI jest najszerszą z opcji ogólnego przeznaczenia. Tekst, obraz, wideo, dźwięk, embeddingi i rerank, każdy backend to usługa gRPC we własnym obrazie OCI, bez wymogu karty GPU, wykresy Helm, a od czerwca 2026 prawdziwy tryb rozproszony. Flaga --p2p generuje wspólny token, instancje odkrywają się nawzajem przez libp2p i EdgeVPN, żądania federują do najmniej obciążonego węzła, a router v3 oparty na NATS zna stan VRAM i pamięci podręcznej prefiksów. Obrazy backendów są podpisywane przez cosign. Czego nie robi: nie wynajmuje karty GPU, nie dzieli żądania innego niż LLM między maszyny, nie trenuje. Przepustowość samego LLM ustępuje dedykowanemu silnikowi o kilkadziesiąt procent, pisze autor, bo ogólność kosztuje.
GPUStack i Xinference są zgrupowane jako konstrukcje nadzorcy i workerów z konsolami webowymi, oba wspierane przez firmy i oba widywane przez autora we wdrożeniach klastrowych w Azji. GPUStack, 5,7 tys. gwiazdek, jest bardziej operacyjny: użytkownicy i role, klucze API z pomiarem zużycia, Prometheus i Grafana, automatyczne odtwarzanie nieudanych modeli, logi workerów Ray w interfejsie oraz wsparcie dla dziewięciu dostawców akceleratorów, w tym Ascend, Hygon i MThreads. Xinference, 9,6 tys. gwiazdek, dodaje wspólną pamięć podręczną KV między replikami, gdy na zapleczu działa vLLM.
Stoi przed setką dostawców i twoimi własnymi endpointami, z kluczami, budżetami i śledzeniem wydatków, a sam nie uruchamia żadnego modelu.
To zdanie dotyczy LiteLLM, który w zestawieniu bywa brany za rozwiązanie do self-hostingu. Nim nie jest. Rozdziela ruch między endpointy i chmury, a sam nie uruchamia żadnych wag.
Dwie pozycje najmocniej osadzone w produkcji nie dotyczą przede wszystkim kosztu. NVIDIA Dynamo, 8,1 tys. gwiazdek, i llm-d, 4,6 tys., robią rozdzielony prefill i decode z routingiem świadomym KV, a oba wymagają Kubernetesa na sprzęcie NVIDIA. SkyPilot i dstack, 10,6 tys. i 2,3 tys. gwiazdek, planują zadania między klastrami i potrafią rozszerzyć się do chmury, co jest innym problemem niż wydajne serwowanie modelu. CoderAI, nowy i bez gwiazdek, to projekt samego autora, ujawniony na wstępie, i deklaruje budżetowe rozszerzanie do chmury na model oraz rozproszone LoRA, z obrazami podpisywanymi przez cosign na Linuksie z CUDA i Vulkan.
Dwa projekty wymieniono tylko po to, żeby je wykluczyć. Petals miał ostatni commit w 2024. Hugging Face TGI zarchiwizowano w marcu 2026. Zestawienie odnotowuje też, że production-stack vLLM jest jedyną opcją kubernetesową w tabeli oznaczoną jako gotową do produkcji spośród samych silników, a podpisane obrazy są rzadkością: cosign używają LocalAI i CoderAI, większość rynku nie.
Zespołom rozważającym, gdzie trafiają pieniądze na wnioskowanie, zestawienie nie daje tabeli cen. Daje coś mniej wygodnego: mapę tego, które orkiestratory faktycznie potrafią użyć drugiej karty GPU, które nie potrafią, a które powiedzą o tym w swojej dokumentacji.
Źródła
1Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.