Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I motori di inferenza open source tagliano i costi di AI-SQL e degli agenti, dicono i benchmark

Il 30 settembre due progetti open source di inferenza hanno pubblicato benchmark che promettono forti riduzioni del costo di esecuzione dei carichi di lavoro AI. Un indice dei prezzi separato colloca intanto il token di output mediano a 6 dollari per milione.

IA e modelliSpiegatoGiulia FerrariPubblicato: 30 settembre 20263 min di letturaFonti 5
I motori di inferenza open source tagliano i costi di AI-SQL e degli agenti, dicono i benchmark

Il 30 settembre Modal e il Full Stack Data Lab della Carnegie Mellon University hanno lanciato Quail. È un motore di inferenza che ottimizza insieme la pianificazione delle query SQL e l'esecuzione del modello linguistico. Secondo il blog di Modal, Quail elabora più di un miliardo di token al minuto su una singola GPU H100. È oltre 10 volte più veloce della sua baseline vLLM sullo stesso hardware. Sull'infrastruttura di Modal, scrive il blog, il costo scende sotto i 6 centesimi per miliardo di token.

Il blog del Full Stack Data Lab, pubblicato il 24 settembre e ripreso insieme al post di Modal, spiega il problema. AI-SQL estende SQL con funzioni che richiamano un modello linguistico per ogni riga. Una singola query di filtro può quindi innescare centinaia di migliaia o milioni di chiamate al modello. Il laboratorio attribuisce il supporto a Snowflake Cortex AISQL, alle funzioni AI di BigQuery, alle funzioni AI di Databricks e, di recente, a MotherDuck.

Quail è l'ultimo di diversi annunci di efficienza arrivati questa settimana. Il 30 settembre il progetto open source Magnitude è approdato su GitHub. Si presenta come un motore di inferenza per agenti che compila e ottimizza i kernel sull'hardware dell'utente. Il suo README dichiara velocità di decodifica fino a 2 volte superiori a llama.cpp, con il 92% in più sulla decodifica su Metal e il 19% su CUDA, e il 27% in meno di memoria per agente. Magnitude gira su Apple Silicon, NVIDIA, AMD o solo CPU. Si collega a Pi, OpenCode, Hermes e Codex con un solo clic.

Su una query con più join, dove la pianificazione è particolarmente importante, Quail supera il miliardo di token elaborati al minuto per GPU H100 (TPM/GPU), oltre 10 volte più veloce della nostra baseline vLLM sullo stesso hardware.

I due progetti attaccano colli di bottiglia diversi. Magnitude punta ai carichi di lavoro degli agenti locali, dove il vincolo è l'adattamento dei kernel ai chip consumer o delle workstation. Quail punta ai carichi di lavoro dei database, dove il vincolo è l'overhead dell'host e la rimozione della KV cache. Il Full Stack Data Lab ha misurato una baseline vLLM su BIO-4, una query su referti medici, a 6,84 ore. Sono 27,55 volte la sua stessa stima di velocità limite, pari a 14,91 minuti.

Restano sullo sfondo i conti dell'hardware. Un articolo presentato a SOSP '26 e pubblicato il 30 settembre descrive EnerTune, un sistema di condivisione delle GPU. Gli autori affermano che riduce il consumo energetico da 1,4 a 2,3 volte e la potenza assorbita da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni. Sostengono anche che ottimizzare solo l'utilizzo della GPU può far salire il consumo energetico. E aggiungono che profilare ogni configurazione su larga scala costa troppo.

I prezzi di listino restano distanti

Sul fronte dei prezzi, AICostBudget ha pubblicato il 30 settembre il suo indice di settembre. Si basa su 81 record pubblici di prezzi congelati di 11 fornitori. Colloca il prezzo mediano di input a 1,32 dollari per milione di token e il prezzo mediano di output a 6 dollari, un rapporto di 5,0 volte. L'intervallo osservato va da 0,10 a 30 dollari per milione per l'input e da 0,10 a 180 dollari per l'output.

L'indice riporta uno sconto mediano del 90% sull'input in cache su 58 record comparabili. Riporta uno sconto mediano Batch del 50% su 44 record. Per prezzo mediano di input del fornitore, Mistral AI è il più basso a 0,20 dollari. DeepSeek è a 0,30, Google Gemini a 0,75, Moonshot AI a 0,95, xAI a 1,25, Cohere a 1,50, OpenAI a 2 e Anthropic a 5.

Non tutti i record sono direttamente comparabili. AICostBudget afferma che 17 record usano prezzi a scaglioni o per contesto lungo e 13 usano componenti non legati ai token, come pagine di documenti o durata della sessione. Questi restano fuori dalle sue mediane sui token. Nota anche che la sua finestra di rilevazione inizia a luglio 2026 e non rivendica un calo annuo dei prezzi a livello di settore.

Intanto, il costo ingegneristico di non ottimizzare si vede nei numeri di Quail. Il laboratorio afferma che vLLM ha elaborato 174,6 milioni di token di cui non aveva bisogno su BIO-4, a causa del KV regret, e che la pianificazione della CPU ha lasciato la H100 inattiva. Sono le lacune che Magnitude e Quail stanno entrambi cercando di colmare, dai due estremi dello stack.

Commenti 0

Fonti

5
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  4. 04AI API pricing index - September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.