Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Inferenza self-hosted, non il prezzo delle API: è qui che il divario di costo è più ampio

Un confronto del settembre 2026 tra sette orchestratori di inferenza self-hosted ha rilevato che l'opzione più economica non offre alcun clustering, mentre gli strumenti che coprono più GPU portano avvertenze che i README dei fornitori non nascondono.

IA e modelliNotiziaChiara RomanoPubblicato: 27 settembre 20264 min di letturaFonti 1
Inferenza self-hosted, non il prezzo delle API: è qui che il divario di costo è più ampio

L'indagine l'ha pubblicata Nexlab il 20 settembre. Il confronto mette a fianco LocalAI, exo, GPUStack, Xinference, Ollama, vLLM e CoderAI su ciò che interessa davvero a chi compra: supporto multi-macchina, routing consapevole della cache, burst sul cloud e training. I conteggi delle stelle arrivano dall'API di GitHub alla stessa data, le celle sulle funzionalità dai README e dalla documentazione dei progetti. Dove l'autore non ha potuto confermare qualcosa, la cella lo dice invece di tirare a indovinare.

La classifica non è quella che prevederebbe una presentazione di gara. Ollama, con 181.000 stelle, è descritto come la risposta giusta per un portatile o un singolo desktop, e niente di più: una macchina, un modello alla volta, senza alcuna storia di cluster oltre al round-robin di Open WebUI su diversi URL di Ollama. A chi ha bisogno di altro viene detto di smettere di leggere a quel punto dell'articolo. Nella stessa colonna sta llamafile di Mozilla, un singolo eseguibile per Linux, macOS, Windows e i BSD, per progetto su una sola macchina.

I progetti che coprono più hardware sono quelli costosi da gestire. vLLM fa parallelismo tensoriale e di pipeline su Ray e prefix caching per istanza, ma non gestisce modelli, utenti o collocazione. llama.cpp, a 129.000 stelle, arriva attraverso più macchine con un rpc-server su ciascuna e un flag --rpc sull'host. Nessuno dei due è un orchestratore nel senso in cui lo intende la maggior parte di chi compra. Sono ciò che LocalAI, GPUStack, Xinference e CoderAI eseguono sotto.

L'eccezione macOS e il vuoto su Linux

exo riceve l'endorsement più forte del pezzo. Scoperta zero-config, partizionamento ring, pipeline e tensoriale proporzionale alla memoria di ogni dispositivo, MLX sotto, e RDMA su Thunderbolt 5 sui Mac recenti. Il numero del fornitore è 3,2x di scaling su quattro dispositivi per il parallelismo tensoriale. Ma a settembre 2026 exo è solo CPU su Linux, con il supporto NVIDIA e AMD elencato come in sviluppo, e serve modelli linguistici, con la generazione di immagini dietro un feature flag. Il verdetto dell'indagine è netto: se il vostro hardware è Apple Silicon, niente altro si avvicina; se non lo è, exo non fa per voi, per ora.

LocalAI è il più ampio tra le opzioni general-purpose. Testo, immagini, video, audio, embedding e rerank, ogni backend un servizio gRPC nella propria immagine OCI, nessuna GPU richiesta, Helm chart, e da giugno 2026 una vera modalità distribuita. Un flag --p2p genera un token condiviso, le istanze si scoprono tra loro su libp2p ed EdgeVPN, le richieste si federano verso il nodo meno carico, e un router v3 basato su NATS è consapevole della VRAM e delle prefix cache. Le immagini dei backend sono firmate con cosign. Cosa non fa: affittare una GPU, dividere una richiesta non-LLM su più macchine, o fare training. Il throughput grezzo sugli LLM resta indietro di alcune decine di punti percentuali rispetto a un motore dedicato, scrive l'autore, perché la generalità costa.

GPUStack e Xinference sono raggruppati come progetti supervisor-più-worker con console web, entrambi sostenuti da aziende, ed entrambi quelli che l'autore vede distribuiti come cluster in Asia. GPUStack, 5.700 stelle, è il più operativo: utenti e ruoli, chiavi API con metering, Prometheus e Grafana, recupero automatico dei modelli falliti, log dei worker Ray nella UI, e supporto per nove fornitori di acceleratori tra cui Ascend, Hygon e MThreads. Xinference, a 9.600 stelle, aggiunge la KV cache condivisa tra le repliche quando esegue vLLM sul back end.

Sta davanti a un centinaio di fornitori e ai vostri endpoint con chiavi, budget e tracciamento della spesa, e non esegue mai un modello.

Quella riga riguarda LiteLLM, che secondo l'indagine viene spesso scambiato per una soluzione di self-hosting. Non lo è. Instrada tra endpoint e verso i cloud, e non esegue pesi propri.

Le due voci con la cornice produttiva più forte non riguardano principalmente il costo. NVIDIA Dynamo, 8.100 stelle, e llm-d, 4.600, fanno prefill e decode disaggregati con routing consapevole della KV, e entrambi richiedono Kubernetes su hardware NVIDIA. SkyPilot e dstack, 10.600 e 2.300 stelle, schedulano i vostri job su più cluster e possono sfondare sul cloud, che è un problema diverso dal servire un modello in modo efficiente. CoderAI, nuovo e senza stelle, è il progetto dell'autore stesso, dichiarato in apertura, e rivendica burst sul cloud con budget per modello più LoRA distribuito, con immagini firmate con cosign su Linux CUDA e Vulkan.

Due progetti sono nominati solo per essere esclusi. L'ultimo commit su Petals è del 2024. Hugging Face TGI è stato archiviato a marzo 2026. L'indagine nota anche che il production-stack di vLLM è l'unica opzione Kubernetes nella tabella contrassegnata come pronta per la produzione tra i motori stessi, e che le immagini firmate sono rare: LocalAI e CoderAI usano cosign, e la maggior parte del settore no.

Per i team che valutano dove finiscono i soldi dell'inferenza, l'indagine non offre una tabella dei prezzi. Offre qualcosa di meno comodo: una mappa di quali orchestratori possono davvero usare una seconda GPU, quali no, e quali ve lo diranno nella loro stessa documentazione.

Commenti 0

Fonti

1
  1. 01Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.