Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Il costo dell'inferenza si sposta al centro dello stack AI con i nuovi motori

Magnitude, startup di Y Combinator S25, ha pubblicato il suo motore di inferenza open source su GitHub il 30 settembre, sostenendo che i modelli aperti girano fino a 2 volte più veloci di llama.cpp sullo stesso hardware.

IA e modelliAnalisiGiulia FerrariPubblicato: 30 settembre 20267 min di letturaFonti 9
Il costo dell'inferenza si sposta al centro dello stack AI con i nuovi motori

Secondo la scheda su GitHub, Magnitude ha pubblicato il repository il 30 settembre alle 17:37 UTC. La proposta è stretta e specifica: un motore di inferenza per agenti che compila e ottimizza i kernel sul dispositivo su cui gira. L'azienda sostiene che questo produce prestazioni fino a 2 volte più veloci di llama.cpp, con una decodifica più rapida del 92% sul backend Metal di Apple e del 19% su CUDA.

La rivendicazione è un benchmark del fornitore. Nessuno fuori da Magnitude l'ha ancora riprodotta. Il repository non indica i modelli, la lunghezza dei prompt o le dimensioni dei batch dietro quei numeri. Trattate il 2x come cifra di marketing finché qualcuno indipendente non lo esegue.

Conta di più dove punta l'azienda. Magnitude dice di distribuire un'app desktop che si collega agli agenti che le persone già usano, elencando Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi e Cline. Tutto il resto passa attraverso un'API compatibile con OpenAI. Il motore gira su Apple Silicon, GPU NVIDIA o AMD, oppure su sola CPU, secondo il repo. Magnitude sostiene anche il 27% in meno di memoria per agente, liberata quando gli agenti si fermano, e afferma che le sessioni condividono le cache dei prefissi per evitare rallentamenti in concorrenza.

La stessa settimana, un altro strato dello stack

Due ore più tardi, il 30 settembre, è arrivata una seconda release. Full Stack Data Lab ha pubblicato un post sul blog dedicato a Quail, uno strato di inferenza consapevole della query costruito con Modal, e Modal ha messo online il proprio articolo alle 17:38 UTC dello stesso giorno. Quail attacca l'AI-SQL, la pratica di chiamare modelli linguistici riga per riga dall'interno delle query SQL.

I numeri sono grandi e l'inquadramento è diretto. Full Stack Data Lab dice che una singola query può generare centinaia di migliaia o milioni di chiamate al modello, perché una funzione AI valuta un prompt per riga, e un join ingenuo valuta un prompt per ogni coppia di righe. Su una query di benchmark chiamata BIO-4, che unisce 5.000 referti medici a 4.144 termini di reazione, il laboratorio ripercorre il costo di inviare quelle chiamate a un motore generico come vLLM sotto forma di richieste separate.

Il post di Modal riporta il risultato: Quail elabora oltre un miliardo di token al minuto per GPU H100 su una query multi-join, più di 10 volte più veloce della sua baseline vLLM sullo stesso hardware, a meno di 6 centesimi per miliardo di token su Modal. Su un benchmark appena pubblicato, Modal dice che Quail gira 1,84 volte più veloce di vLLM, in media geometrica sui task. Segnala che l'insieme include due query pensate per mostrare dove l'inferenza AI-SQL ha ancora bisogno di lavoro.

Lo vedo come un punto sulla curva pareto-ottimale degli LLM in un regime che aveva una grande domanda latente rivelata (niente thinking, token singolo, intelligenza accettabile a bassa latenza) che è stata sottofinanziata a causa della corsa verso un'intelligenza superiore. Karpathy-san, su Jev

Quella citazione compare nel post di Modal, attribuita lì a Karpathy, che commenta il modello Jev di TypeSafe AI. Vale la pena leggerla con attenzione. L'argomento è che molta domanda di inferenza si colloca all'estremità economica e a bassa latenza ed è stata poco servita perché i laboratori inseguivano la capacità di frontiera. Sia Magnitude sia Quail sono scommesse su quel divario.

Nessuno dei due articoli è peer reviewed. Entrambi sono blog aziendali che accompagnano release di codice, e le baseline di confronto, una contro llama.cpp, una contro vLLM, sono scelte dagli autori. La direzione di marcia è coerente, ma le grandezze non vanno trattate come stabilite.

Cosa dicono l'elettricità e il listino prezzi

Un lavoro accademico pubblicato questa settimana indica un problema correlato che token più veloci non risolvono da soli. Un paper presentato a SOSP '26, datato 28 settembre e inserito negli atti ACM, sostiene che ottimizzare i cluster GPU puramente per l'utilizzo può aumentare il consumo energetico. Gli autori, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, descrivono un sistema chiamato EnerTune che modella analiticamente prestazioni e potenza per modello invece di profilare ogni configurazione, e impacchetta i modelli su GPU condivise di conseguenza. Riportano una riduzione del consumo energetico da 1,4 a 2,3 volte e della potenza assorbita da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte, pur rispettando gli obiettivi di prestazioni.

Poi c'è il lato dei prezzi di listino. AICostBudget ha pubblicato il 30 settembre il suo indice dei prezzi di settembre, un'istantanea congelata a un cutoff del 2026-09-30 UTC, che copre 81 record di prezzi pubblici su 11 fornitori. Il prezzo mediano di input su 69 record è 1,32 dollari per milione di token e il prezzo mediano di output è 6 dollari per milione, un rapporto di 5,0 volte. Di solito è il prezzo di output, non l'ingestione del prompt, la componente più grande.

Quell'indice smonta anche una scorciatoia comune nei discorsi sui costi. Di 58 record comparabili con input in cache, lo sconto mediano è del 90%. Di 44 record con prezzi a batch, lo sconto mediano è del 50%. Qualsiasi confronto di carichi di lavoro che ignori caching e prezzi a batch descrive una bolletta che la maggior parte dei clienti non vedrà mai, e l'indice lo dice apertamente. Sul lato fornitori, le sue mediane vanno da Mistral AI a 0,20 dollari di input e 0,60 di output per milione di token su 7 record, e DeepSeek a 0,30 e 1,20 su 3, fino ad Anthropic a 5 e 25 su 13 record e OpenAI a 2 e 11 su 18. Sono mediane di prezzi di listino pubblici, non prezzi effettivi al netto degli sconti, e le popolazioni hanno dimensioni diverse, quindi non sono una classifica dei modelli a parità di condizioni.

La velocità è solo uno dei costi

Fuori dal data center, la latenza ha un costo fisico misurabile. MindOn ha presentato il 30 settembre il suo modello di AI fisica Mind-1, dicendo che riduce la latenza di inferenza dei robot da 82ms a 32ms e porta i task di manipolazione a tempi di ciclo umani. La spiegazione dell'azienda sul perché questo conta è la parte utile: a una velocità dell'end-effector di 3 metri al secondo, 10ms di latenza corrispondono a circa 3cm di movimento, abbastanza da influire su una presa o un inserimento precisi. MindOn segnala anche un problema di dati, notando che gran parte dei dati di manipolazione robotica viene dalla teleoperazione, più lenta del movimento umano naturale, così i modelli imparano un ritmo più lento insieme al task.

C'è una storia di costi per i consumatori nella stessa finestra. CleanTechnica ha riportato il 29 settembre che l'analisi di Transport & Environment stima i costi di esercizio delle auto elettriche a meno della metà del diesel per chilometro in Europa, sulla base di un consumo medio di 6,9 litri per 100km per il diesel e 20,2 kWh per 100km per le elettriche a batteria, con l'elettricità a 0,343 € per kWh. Antony Froggatt di T&E ha detto nel post che i guidatori diesel pagano 32 € in più per pieno rispetto all'inizio dell'anno e ha avvertito di un rischio di approvvigionamento se gli Stati Uniti bloccano le esportazioni di diesel. T&E nota che la sua stima di ricarica è probabilmente un limite superiore.

E la pagina dei prezzi stessa può essere un costo. Un resoconto in prima persona pubblicato il 30 settembre da Gokhan Kogan, che descrive il suo periodo in Pinecone, riporta che un calcolatore di utilizzo sulla pagina dei prezzi produceva stime gonfiate fino a 1.000 volte dopo un singolo input interpretato male. In un test A/B, scrive, i visitatori che non vedevano il calcolatore avevano il 16% in più di probabilità di registrarsi e il 90% in più di contattare l'azienda, senza aumento dei ticket di supporto sui prezzi. Nota anche che 7 dipendenti su 10 intervistati internamente si aspettavano che la versione con calcolatore andasse meglio. È l'esperienza di una sola azienda, non una legge generale, ma ricorda che costo percepito e costo reale divergono facilmente.

L'economia della capacità sta cambiando anche a livello di rete. Light Reading ha riportato il 30 settembre che StarHub e M1 sono in trattative di fusione a Singapore, dove già condividono lo spettro 5G e la rete di accesso radio attraverso una società controllata insieme chiamata Antina. A giugno Singtel deteneva il 43% del mercato mobile, con M1 al 22%, StarHub al 21% e Simba al 14%, secondo il resoconto. In Nuova Zelanda, 2degrees e OneNZ hanno proposto di combinare le loro reti radio, con una decisione della Commerce Commission attesa l'anno prossimo.

Il filo conduttore non è che l'inferenza stia per diventare gratuita. È che le ottimizzazioni in arrivo questa settimana mirano a colli di bottiglia specifici, la velocità di decodifica degli agenti su hardware consumer, le chiamate SQL riga per riga e la potenza delle GPU inattive, e ognuna arriva con il proprio benchmark e il proprio fornitore. L'indice dei prezzi suggerisce che i prezzi di listino in sé non si sono mossi molto. I risparmi vengono venduti allo strato del motore, e gli acquirenti dovranno testarli sui propri carichi di lavoro.

Commenti 0

Fonti

9
  1. 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04AI API pricing index - September 2026EN
  5. 05Mind-1: Cutting robot inference latency from 82ms to 32msEN
  6. 06The pricing calculator made people more confused about pricingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.