Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Koszt self-hostingu rozstrzyga się nie w cennikach API

Wrześniowe zestawienie z 2026 roku siedmiu orkiestratorów wnioskowania self-hosted pokazało, że najtańsza opcja nie oferuje żadnego klastrowania, a narzędzia obsługujące wiele kart GPU mają zastrzeżenia, których README producentów nie ukrywają.

AI i modeleNewsAnna KaczmarekOpublikowano: 27 września 20264 min czytaniaŹródła 1
Koszt self-hostingu rozstrzyga się nie w cennikach API

Zestawienie opublikowane przez Nexlab 20 września porównuje LocalAI, exo, GPUStack, Xinference, Ollama, vLLM i CoderAI pod kątem tego, co naprawdę liczy się dla kupującego: obsługi wielu maszyn, routingu świadomego pamięci podręcznej, rozszerzania do chmury i treningu. Liczby gwiazdek pochodzą z API GitHuba z tego samego dnia, a informacje o funkcjach z README i dokumentacji samych projektów. Tam, gdzie autor nie mógł czegoś potwierdzić, pole mówi o tym wprost, zamiast zgadywać.

Ranking nie wygląda tak, jak przewidywałby to dział zakupów. Ollama, z 181 000 gwiazdek, jest opisana jako właściwy wybór na laptopa albo jeden komputer stacjonarny i nic więcej: jedna maszyna, jeden model naraz, bez historii klastrowej poza rozwinięciem kilku adresów Ollama przez Open WebUI. Kto potrzebuje więcej, temu autor radzi przerwać lekturę w tym miejscu. llamafile od Mozilli trafia do tej samej kolumny: pojedynczy plik wykonywalny dla Linuksa, macOS, Windows i systemów BSD, z założenia na jednej maszynie.

Projekty, które faktycznie obejmują wiele maszyn, są drogie w utrzymaniu. vLLM realizuje równoległość tensorową i potokową przez Ray oraz buforowanie prefiksów na instancję, ale nie zarządza modelami, użytkownikami ani rozmieszczeniem. llama.cpp, z 129 000 gwiazdek, sięga między maszynami przez rpc-server na każdym komputerze i flagę --rpc na hoście. Żaden z nich nie jest orkiestratorem w tym sensie, o jaki chodzi większości kupujących. To podłoże, na którym działają LocalAI, GPUStack, Xinference i CoderAI.

Wyjątek macOS i luka na Linuksie

exo dostaje w tekście najmocniejsze pojedyncze poparcie. Odkrywanie bez konfiguracji, partycjonowanie pierścieniowe, potokowe i tensorowe proporcjonalne do pamięci każdego urządzenia, pod spodem MLX, a na nowszych Macach RDMA po Thunderbolt 5. Liczba podana przez producenta to skalowanie 3,2 raza na czterech urządzeniach przy równoległości tensorowej. We wrześniu 2026 exo działa jednak na Linuksie tylko na procesorze, wsparcie dla NVIDIA i AMD jest w przygotowaniu, a obsługuje modele językowe, generowanie obrazów jest za flagą funkcji. Werdykt zestawienia jest ostry: jeśli masz sprzęt Apple Silicon, nic innego się nie zbliża; jeśli nie, exo jeszcze nie jest dla ciebie.

LocalAI jest najszerszą z opcji ogólnego przeznaczenia. Tekst, obraz, wideo, dźwięk, embeddingi i rerank, każdy backend to usługa gRPC we własnym obrazie OCI, bez wymogu karty GPU, wykresy Helm, a od czerwca 2026 prawdziwy tryb rozproszony. Flaga --p2p generuje wspólny token, instancje odkrywają się nawzajem przez libp2p i EdgeVPN, żądania federują do najmniej obciążonego węzła, a router v3 oparty na NATS zna stan VRAM i pamięci podręcznej prefiksów. Obrazy backendów są podpisywane przez cosign. Czego nie robi: nie wynajmuje karty GPU, nie dzieli żądania innego niż LLM między maszyny, nie trenuje. Przepustowość samego LLM ustępuje dedykowanemu silnikowi o kilkadziesiąt procent, pisze autor, bo ogólność kosztuje.

GPUStack i Xinference są zgrupowane jako konstrukcje nadzorcy i workerów z konsolami webowymi, oba wspierane przez firmy i oba widywane przez autora we wdrożeniach klastrowych w Azji. GPUStack, 5,7 tys. gwiazdek, jest bardziej operacyjny: użytkownicy i role, klucze API z pomiarem zużycia, Prometheus i Grafana, automatyczne odtwarzanie nieudanych modeli, logi workerów Ray w interfejsie oraz wsparcie dla dziewięciu dostawców akceleratorów, w tym Ascend, Hygon i MThreads. Xinference, 9,6 tys. gwiazdek, dodaje wspólną pamięć podręczną KV między replikami, gdy na zapleczu działa vLLM.

Stoi przed setką dostawców i twoimi własnymi endpointami, z kluczami, budżetami i śledzeniem wydatków, a sam nie uruchamia żadnego modelu.

To zdanie dotyczy LiteLLM, który w zestawieniu bywa brany za rozwiązanie do self-hostingu. Nim nie jest. Rozdziela ruch między endpointy i chmury, a sam nie uruchamia żadnych wag.

Dwie pozycje najmocniej osadzone w produkcji nie dotyczą przede wszystkim kosztu. NVIDIA Dynamo, 8,1 tys. gwiazdek, i llm-d, 4,6 tys., robią rozdzielony prefill i decode z routingiem świadomym KV, a oba wymagają Kubernetesa na sprzęcie NVIDIA. SkyPilot i dstack, 10,6 tys. i 2,3 tys. gwiazdek, planują zadania między klastrami i potrafią rozszerzyć się do chmury, co jest innym problemem niż wydajne serwowanie modelu. CoderAI, nowy i bez gwiazdek, to projekt samego autora, ujawniony na wstępie, i deklaruje budżetowe rozszerzanie do chmury na model oraz rozproszone LoRA, z obrazami podpisywanymi przez cosign na Linuksie z CUDA i Vulkan.

Dwa projekty wymieniono tylko po to, żeby je wykluczyć. Petals miał ostatni commit w 2024. Hugging Face TGI zarchiwizowano w marcu 2026. Zestawienie odnotowuje też, że production-stack vLLM jest jedyną opcją kubernetesową w tabeli oznaczoną jako gotową do produkcji spośród samych silników, a podpisane obrazy są rzadkością: cosign używają LocalAI i CoderAI, większość rynku nie.

Zespołom rozważającym, gdzie trafiają pieniądze na wnioskowanie, zestawienie nie daje tabeli cen. Daje coś mniej wygodnego: mapę tego, które orkiestratory faktycznie potrafią użyć drugiej karty GPU, które nie potrafią, a które powiedzą o tym w swojej dokumentacji.

Komentarze 0

Źródła

1
  1. 01Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.