Inferenza self-hosted, non il prezzo delle API: è qui che il divario di costo è più ampio
Un confronto del settembre 2026 tra sette orchestratori di inferenza self-hosted ha rilevato che l'opzione più economica non offre alcun clustering, mentre gli strumenti che coprono più GPU portano avvertenze che i README dei fornitori non nascondono.

L'indagine l'ha pubblicata Nexlab il 20 settembre. Il confronto mette a fianco LocalAI, exo, GPUStack, Xinference, Ollama, vLLM e CoderAI su ciò che interessa davvero a chi compra: supporto multi-macchina, routing consapevole della cache, burst sul cloud e training. I conteggi delle stelle arrivano dall'API di GitHub alla stessa data, le celle sulle funzionalità dai README e dalla documentazione dei progetti. Dove l'autore non ha potuto confermare qualcosa, la cella lo dice invece di tirare a indovinare.
La classifica non è quella che prevederebbe una presentazione di gara. Ollama, con 181.000 stelle, è descritto come la risposta giusta per un portatile o un singolo desktop, e niente di più: una macchina, un modello alla volta, senza alcuna storia di cluster oltre al round-robin di Open WebUI su diversi URL di Ollama. A chi ha bisogno di altro viene detto di smettere di leggere a quel punto dell'articolo. Nella stessa colonna sta llamafile di Mozilla, un singolo eseguibile per Linux, macOS, Windows e i BSD, per progetto su una sola macchina.
I progetti che coprono più hardware sono quelli costosi da gestire. vLLM fa parallelismo tensoriale e di pipeline su Ray e prefix caching per istanza, ma non gestisce modelli, utenti o collocazione. llama.cpp, a 129.000 stelle, arriva attraverso più macchine con un rpc-server su ciascuna e un flag --rpc sull'host. Nessuno dei due è un orchestratore nel senso in cui lo intende la maggior parte di chi compra. Sono ciò che LocalAI, GPUStack, Xinference e CoderAI eseguono sotto.
L'eccezione macOS e il vuoto su Linux
exo riceve l'endorsement più forte del pezzo. Scoperta zero-config, partizionamento ring, pipeline e tensoriale proporzionale alla memoria di ogni dispositivo, MLX sotto, e RDMA su Thunderbolt 5 sui Mac recenti. Il numero del fornitore è 3,2x di scaling su quattro dispositivi per il parallelismo tensoriale. Ma a settembre 2026 exo è solo CPU su Linux, con il supporto NVIDIA e AMD elencato come in sviluppo, e serve modelli linguistici, con la generazione di immagini dietro un feature flag. Il verdetto dell'indagine è netto: se il vostro hardware è Apple Silicon, niente altro si avvicina; se non lo è, exo non fa per voi, per ora.
LocalAI è il più ampio tra le opzioni general-purpose. Testo, immagini, video, audio, embedding e rerank, ogni backend un servizio gRPC nella propria immagine OCI, nessuna GPU richiesta, Helm chart, e da giugno 2026 una vera modalità distribuita. Un flag --p2p genera un token condiviso, le istanze si scoprono tra loro su libp2p ed EdgeVPN, le richieste si federano verso il nodo meno carico, e un router v3 basato su NATS è consapevole della VRAM e delle prefix cache. Le immagini dei backend sono firmate con cosign. Cosa non fa: affittare una GPU, dividere una richiesta non-LLM su più macchine, o fare training. Il throughput grezzo sugli LLM resta indietro di alcune decine di punti percentuali rispetto a un motore dedicato, scrive l'autore, perché la generalità costa.
GPUStack e Xinference sono raggruppati come progetti supervisor-più-worker con console web, entrambi sostenuti da aziende, ed entrambi quelli che l'autore vede distribuiti come cluster in Asia. GPUStack, 5.700 stelle, è il più operativo: utenti e ruoli, chiavi API con metering, Prometheus e Grafana, recupero automatico dei modelli falliti, log dei worker Ray nella UI, e supporto per nove fornitori di acceleratori tra cui Ascend, Hygon e MThreads. Xinference, a 9.600 stelle, aggiunge la KV cache condivisa tra le repliche quando esegue vLLM sul back end.
Sta davanti a un centinaio di fornitori e ai vostri endpoint con chiavi, budget e tracciamento della spesa, e non esegue mai un modello.
Quella riga riguarda LiteLLM, che secondo l'indagine viene spesso scambiato per una soluzione di self-hosting. Non lo è. Instrada tra endpoint e verso i cloud, e non esegue pesi propri.
Le due voci con la cornice produttiva più forte non riguardano principalmente il costo. NVIDIA Dynamo, 8.100 stelle, e llm-d, 4.600, fanno prefill e decode disaggregati con routing consapevole della KV, e entrambi richiedono Kubernetes su hardware NVIDIA. SkyPilot e dstack, 10.600 e 2.300 stelle, schedulano i vostri job su più cluster e possono sfondare sul cloud, che è un problema diverso dal servire un modello in modo efficiente. CoderAI, nuovo e senza stelle, è il progetto dell'autore stesso, dichiarato in apertura, e rivendica burst sul cloud con budget per modello più LoRA distribuito, con immagini firmate con cosign su Linux CUDA e Vulkan.
Due progetti sono nominati solo per essere esclusi. L'ultimo commit su Petals è del 2024. Hugging Face TGI è stato archiviato a marzo 2026. L'indagine nota anche che il production-stack di vLLM è l'unica opzione Kubernetes nella tabella contrassegnata come pronta per la produzione tra i motori stessi, e che le immagini firmate sono rare: LocalAI e CoderAI usano cosign, e la maggior parte del settore no.
Per i team che valutano dove finiscono i soldi dell'inferenza, l'indagine non offre una tabella dei prezzi. Offre qualcosa di meno comodo: una mappa di quali orchestratori possono davvero usare una seconda GPU, quali no, e quali ve lo diranno nella loro stessa documentazione.
Fonti
1Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.