Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Prezzi dell'inferenza divisi: cache hit, latenza vocale e self-hosting

In un campione controllato, le richieste a DeepSeek V4 Flash con 100k token di input costano 14,9 volte meno a caldo che a freddo. Lo riporta un benchmark pubblicato da inference.academy il 7 settembre 2026.

IA e modelliAnalisiChiara RomanoPubblicato: 27 settembre 20265 min di letturaFonti 3
Prezzi dell'inferenza divisi: cache hit, latenza vocale e self-hosting

Quel singolo rapporto, misurato su 14 route, riassume cosa è successo quest'anno ai prezzi dell'inferenza. La tariffa in evidenza per milione di token non è più il numero che decide una fattura. Ora lo stato della cache, la forma della richiesta e quale upstream risponde alla chiamata spostano il costo di un ordine di grandezza.

L'allestimento di inference.academy era volutamente ristretto. Usava obiettivi di 1.000, 10.000 e 100.000 token di input, ciascuno con un budget di 100 o 1.000 token di output, temperatura 0 e reasoning disattivato. Le richieste a freddo portavano un prefisso unico; quelle a caldo ripetevano lo stesso prompt. L'autore le ha descritte come misurazioni di serving, non come punteggi di qualità del compito. Il costo era definito come addebiti totali della richiesta divisi per i token di input, moltiplicati per 1M, includendo gli addebiti di output. Non è quindi il prezzo di listino dei token di input.

La quota di cache è la somma dei token di input in cache divisa per la somma dei token di input dei successi che riportano entrambi. È una quota di token, non la percentuale di richieste che hanno colpito la cache. La sequenza a caldo include la sua richiesta iniziale.

Il routing ha aggiunto una seconda variabile che lo studio non è riuscito a spiegare del tutto. Su 1.000 token di input e 100 di output con cache fredda, OpenRouter ha restituito 20 nomi di upstream, con Baidu a 18 chiamate, Relace a 14 e AkashML a 13. La stessa forma di richiesta a caldo ha restituito 14 nomi, guidati da Relace a 24, CoreWeave a 16 e DeepSeek a 11. Il rapporto osserva che un prompt ripetuto può raggiungere un upstream diverso, il che può cambiarne il comportamento della cache. E afferma chiaramente che la sola distribuzione non stabilisce perché il routing sia cambiato.

Telnyx ha guidato la velocità di generazione mediana in 12 condizioni su 12, secondo lo stesso benchmark. Il primo token più veloce dipendeva dalla forma della richiesta. Un modello che sembra rapido su un prompt breve, quindi, può non mantenere quella posizione su uno lungo.

I modelli vocali competono sui millisecondi, poi sul prezzo

I benchmark di latenza nel parlato hanno seguito uno schema simile. Nari Labs ha scritto il 14 settembre 2026 che, a metà settembre, è in testa sia al benchmark speech-to-text sia a quello text-to-speech di Coval: primo per latenza e secondo per word error rate nello STT, secondo per latenza e primo per WER nel TTS. Aggiunge un'avvertenza da tenere presente: i dati di Coval possono oscillare ogni 30 minuti.

L'endpoint Qwen3-ASR Fast dell'azienda è classificato primo per time-to-final-segment con un p50 di 44 ms, con un WER del 3,6%, piazzandosi secondo dietro Universal 3.5 Pro di AssemblyAI al 3,5%. Nari afferma che l'endpoint Fast a 0,12 dollari l'ora pareggia il secondo prezzo più basso tra i modelli con tariffe pubbliche note nella directory prezzi di Coval. Universal 3.5 Pro costa 3,75 volte di più, mentre Deepgram Nova 3 costa 2,4 volte di più. L'endpoint Standard sarebbe il più economico a 0,06 dollari l'ora.

Sul versante della sintesi, il modello Qwen3-TTS Fast di Nari è classificato secondo per time-to-first-audio con un p50 di 63 ms e un WER del 3,8%, che l'azienda dice essere primo per qualità. Solo vui di Fluxions registra un TTFA mediano più basso, a 49 ms, da un modello da 300M parametri rispetto al Qwen3-TTS da 1,7B che Nari serve.

A 10 dollari per 1M caratteri, Nari afferma che il suo endpoint Fast è a pari merito come il più economico nella directory di Coval, con ElevenLabs Eleven v3 Conversational a 5 volte di più e Cartesia Sonic 3.6 a 6,5 volte di più.

Il confronto più netto nel post è tra endpoint che servono gli stessi pesi. Nari riporta che l'endpoint ufficiale Qwen3 TTS Flash Realtime si attesta all'8,8% di WER e a un TTFA mediano nell'ordine delle centinaia di millisecondi. L'endpoint dedicato Qwen3-TTS di Baseten registra invece il 6,0% di WER e un TTFA mediano nelle centinaia basse di millisecondi. Stesso modello, stack di serving diverso, numeri diversi.

Anche il self-hosting ha un prezzo, ed è nelle operazioni

L'indagine di Nexlab del 20 settembre 2026 sugli orchestratori self-hosted copre LocalAI, exo, GPUStack, Xinference, Ollama, vLLM e CoderAI, con i conteggi delle stelle GitHub presi dalle API quel giorno. La colonna utile non sono le stelle ma cosa fa ciascuno strumento attraverso più macchine.

  • Ollama, a 181.000 stelle, è una macchina e un modello alla volta, senza alcuna storia di cluster oltre al round-robin su diversi URL di Ollama.
  • vLLM, a 92.000 stelle, gestisce il parallelismo tensoriale e di pipeline su Ray ma non gestisce modelli, utenti o collocazione.
  • LocalAI, a 49.000 stelle, ha aggiunto una modalità distribuita a giugno 2026 con discovery libp2p e un router consapevole di VRAM e cache di prefisso; l'indagine dice che il suo throughput LLM grezzo è indietro rispetto a un motore dedicato di alcune decine di punti percentuali.
  • exo, a 47.000 stelle, scala su Apple Silicon con MLX e RDMA su Thunderbolt 5, riportando 3,2x su quattro dispositivi, ma a settembre 2026 è solo CPU su Linux.
  • GPUStack, a 5.700 stelle, offre utenti, chiavi, metering e Prometheus, e supporta nove fornitori di acceleratori.

LiteLLM, a 59.000 stelle, fa routing tra endpoint e cloud ma non esegue alcun modello. L'indagine sottolinea che questa distinzione spesso sfugge.

Lo schema che attraversa tutte e tre le fonti è che il costo ha smesso di essere una singola tariffa pubblicata. Un gateway che ignora lo stato della cache, un endpoint vocale che ignora la latenza di coda o un orchestratore che ignora i tassi di errore produrranno ciascuno una fattura o un'esperienza utente che il prezzo di listino non aveva previsto.

Quello che nessuna di queste fonti chiarisce è quanto siano durevoli i divari. Gli sconti sulla cache dipendono dal routing, il routing cambia tra una chiamata e l'altra, e le posizioni nei benchmark si spostano nel giro di un'ora. Gli acquirenti che confrontano due fornitori su un singolo numero stanno confrontando la cosa sbagliata.

Commenti 0

Fonti

3
  1. 01DeepSeek V4 Flash across 14 providers: cost, speed and cachingEN
  2. 02Show HN: Nari Qwen3-TTS and Qwen3-ASREN
  3. 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.