Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Corsa ai costi di inferenza: Quail dichiara 1B di token al minuto, Magnitude ottimizza i kernel sul dispositivo

Due team di ingegneri hanno pubblicato il 30 settembre due annunci distinti: il costo di esecuzione dei modelli aperti si può tagliare riscrivendo come i motori di inferenza gestiscono hardware e struttura delle query, invece di aspettare GPU più economiche.

IA e modelliAnalisiGiulia FerrariPubblicato: 30 settembre 20263 min di letturaFonti 6
Corsa ai costi di inferenza: Quail dichiara 1B di token al minuto, Magnitude ottimizza i kernel sul dispositivo

Modal e il Full Stack Data Lab della Carnegie Mellon University hanno dichiarato il 30 settembre che Quail, il motore di inferenza costruito insieme, ha elaborato più di un miliardo di token al minuto su una singola GPU H100, per una query AI-SQL con più join. È oltre 10 volte la loro baseline vLLM sullo stesso hardware, secondo il post sul blog di Modal, e corrisponde a meno di 6 centesimi per miliardo di token sul cloud di Modal.

La rivendicazione si basa su un carico di lavoro specifico. AI-SQL estende l'SQL ordinario con funzioni che chiamano un modello linguistico: un filtro può attivare una chiamata al modello per riga, un join una chiamata per coppia di righe. Il documento tecnico del Full Stack Data Lab descrive una query di benchmark, BIO-4, su 5.000 referti medici e 4.144 termini di reazione. Eseguita su vLLM 0.26.0 con Qwen3 4B FP8 su una H100, ha richiesto 6,84 ore con fattore di scala 1.0. Secondo gli autori è 27,55 volte una stima roofline di 14,91 minuti.

Lavoro sul motore, non sul silicio

Il divario è l'argomento. Gli autori attribuiscono la perdita all'overhead dell'host, con la CPU che pianifica le richieste mentre la H100 resta inattiva, e a quello che chiamano KV regret: vLLM scarta la cache di chiavi e valori di cui avrà bisogno più tardi. Il blog del laboratorio afferma che la query ha elaborato 174,6 milioni di token di lavoro KV sprecato. Quail invece prende in input il piano della query, così può ordinare le richieste per riusare la cache e sfrattarla di proposito.

I due testi non insistono sugli stessi punti. Modal inquadra il risultato attorno alla singola query migliore e alla cifra di 1B di token al minuto. Il Full Stack Data Lab riporta invece che Quail va 1,84 volte più veloce di vLLM se si fa la media geometrica sul suo nuovo benchmark AI-SQL, comprese due query che gli autori hanno progettato per esporre le debolezze rimanenti. Entrambe le serie di numeri vengono dalla stessa collaborazione, quindi non sono una verifica indipendente.

Lo stesso giorno, Magnitude, una società Y Combinator S25, ha aperto il codice del proprio motore di inferenza con licenza Apache 2.0. Il suo repository GitHub dichiara che i modelli aperti girano fino a 2 volte più veloci di llama.cpp, con il 92% in più di velocità di decodifica su Metal e il 19% su CUDA. Il meccanismo è diverso da quello di Quail: Magnitude compila e ottimizza i kernel sul dispositivo dell'utente prima che un modello venga eseguito, puntando ad Apple Silicon, Nvidia, AMD o una CPU semplice. Il repository dichiara anche il 27% di memoria in meno per agente e la condivisione della cache dei prefissi tra sessioni concorrenti.

Entrambe le pubblicazioni arrivano in un mercato dove i prezzi di listino non scendono in modo uniforme. L'istantanea di settembre di AICostBudget, congelata al cutoff UTC del 30 settembre, copre 81 record di prezzi pubblici su 11 fornitori. Indica un input mediano di 1,32 dollari per milione di token e un output mediano di 6 dollari, un rapporto di 5,0 volte, con uno sconto mediano del 90% sull'input in cache e un prezzo batch al 50%. Di solito la componente più costosa è l'output, non l'ingestione del prompt.

Anche il lavoro a livello di hardware viene misurato sull'energia invece che sull'utilizzo. Un articolo pubblicato a SOSP '26 il 28 settembre, Beyond Utilization, sostiene che ottimizzare il multiplexing delle GPU solo per l'utilizzo può far salire il consumo energetico. Il suo sistema, EnerTune, usa modelli analitici della potenza per modello e del consumo dei modelli colocati. Gli autori riportano riduzioni di energia da 1,4 a 2,3 volte e riduzioni di potenza da 1,3 a 2,6 volte rispetto a baseline allo stato dell'arte senza nome, rispettando gli obiettivi di prestazioni.

Una nota di cautela arriva da fuori l'infrastruttura. Gaurav Kogan di Pinecone ha descritto il 30 settembre come l'azienda ha rimosso il proprio calcolatore di prezzi a consumo dopo un test A/B. I visitatori che non lo vedevano avevano il 16% in più di probabilità di registrarsi e il 90% in più di contattare, senza un aumento dei ticket di supporto sui prezzi, ha scritto. La lezione vale anche altrove: uno strumento pensato per chiarire i costi può distorcere la decisione per cui era stato costruito.

Commenti 0

Fonti

6
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Building an Ultra-High Throughput AI-SQL EngineEN
  3. 03Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  4. 04AI API pricing index - September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06The pricing calculator made people more confused about pricingEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.