Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I costi dell'inferenza si dividono in due: meno per token, più per GPU

Magnitude, startup di Y Combinator S25, ha pubblicato il 30 settembre un motore di inferenza open source che, secondo l'azienda, fa girare i modelli aperti fino a 2 volte più velocemente di llama.cpp su Apple Silicon, NVIDIA, AMD o una semplice CPU, senza costi per token. Lo stesso giorno un indice dei prezzi basato su 81 record pubblici ha fissato a 6 dollari per 1M di token il prezzo mediano di listino dell'output, contro 1,32 dollari per l'input.

IA e modelliSpiegatoChiara RomanoPubblicato: 30 settembre 20266 min di letturaFonti 10
I costi dell'inferenza si dividono in due: meno per token, più per GPU

Il repository di Magnitude è comparso il 30 settembre. La proposta è lineare: il motore compila e ottimizza i propri kernel sul dispositivo prima di eseguire un modello, invece di distribuire binari precompilati per grandi classi di hardware. L'azienda dichiara un decode più veloce del 92% su Metal e del 19% su CUDA rispetto a llama.cpp, e il 27% di memoria in meno per agente, liberata quando gli agenti si fermano. La licenza è Apache 2.0.

È una risposta al problema dei costi: smettere di pagare per token.

Non è l'unica, e non è quella verso cui punta il resto del materiale di questa settimana. Quail, un motore di inferenza costruito dal team del Full Stack Data Lab dietro DocETL, prende di mira l'altra metà della bolletta. I suoi autori sostengono che le query AI-SQL, dove una chiamata a un LLM viene eseguita per riga o per coppia di righe, siano servite male dai motori generici. Inviare milioni di chiamate correlate al modello a vLLM come richieste separate comporta un costo elevato, scrivono. Quail invece pianifica insieme la query e l'inferenza.

I numeri sono precisi. Su una query con più join, dove la pianificazione conta di più, Quail supera il miliardo di token elaborati al minuto su una singola GPU H100, che secondo il team è più di 10 volte la sua baseline vLLM sullo stesso hardware. Su Modal questo equivale a meno di 6 centesimi per miliardo di token. Sul benchmark AI-SQL del team il guadagno è più contenuto: 1,84 volte più veloce di vLLM, in media geometrica, incluse due query progettate per mostrare dove l'inferenza AI-SQL è ancora carente.

I prezzi per token non sono l'intera bolletta

L'indice di settembre di AICostBudget, congelato al cutoff UTC del 30 settembre, copre 81 record di prezzo pubblici su 11 fornitori. Sui 69 record con uno scalare corrente per i token di input l'intervallo va da 0,10 a 30 dollari per 1M di token. L'output va da 0,10 a 180 dollari. Il prezzo mediano dell'input è 1,32 dollari e quello dell'output è 6 dollari, un rapporto di 5,0 volte sui 69 record che riportano entrambi.

Le mediane dei fornitori divergono nettamente. I 18 record di input e i 18 di output di OpenAI hanno mediana 2 e 11 dollari. Google Gemini, su 14 e 14, ha mediana 0,75 e 4,125 dollari. I 13 record di Anthropic hanno mediana 5 e 25 dollari. I nove di xAI stanno a 1,25 e 2,50 dollari, i sette di Mistral a 0,20 e 0,60, i tre di DeepSeek a 0,30 e 1,20.

L'indice segnala anche ciò che sfugge a un confronto ingenuo. Su 58 record comparabili lo sconto mediano sull'input in cache è del 90%, e su 44 record compatibili con Batch lo sconto mediano sull'input Batch è del 50%. Il rapporto lo dice senza giri di parole: un confronto tra carichi di lavoro che ignora i prezzi di cache e Batch omette modalità di risparmio pubblicate per una larga parte dei record monitorati. Aggiunge che pagine di documenti, storage, durata della sessione e altre unità basate sul tempo non si possono appiattire senza rischi in una tabella di soli token. È un avvertimento giusto per chiunque costruisca una classifica unica del costo per token.

I dati sui prezzi sono un'istantanea, non un prezzo di equilibrio di mercato. La capacità GPU si muove separatamente.

Dove vanno i soldi delle GPU

Business Insider ha riferito il 30 settembre che OpenAI ha annunciato al DevDay di martedì un livello ChatGPT da 500 dollari al mese, 300 dollari in più rispetto al piano più costoso precedente dell'azienda. Il livello include il calcolo "Ultrafast" per GPT-6 Astra in ChatGPT Work e Codex, che secondo OpenAI è un aumento di velocità di 8 volte in Codex, più il tetto di utilizzo incluso più alto dell'azienda. Business Insider ha anche riferito che OpenAI riapre il piano Pro da 200 dollari dimezzando la quota di calcolo, da 20 volte il piano Plus da 20 dollari a 10 volte, e tagliando i messaggi chat di GPT-6 Pro da 200 a 100 a settimana. Thibault Sottiaux, responsabile engineering di Codex, ha detto in un post su X di lunedì che le modifiche si traducono in metà della spesa in dollari per API rispetto al piano precedente.

Sul fronte hardware, il paper SOSP '26 di Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, pubblicato il 28 settembre, sostiene una tesi che va contro la metrica di utilizzo abituale. Le GPU costano care, eppure i cluster di inferenza restano largamente sotto-utilizzati, così i sistemi adottano il multiplexing. Ma gli autori scrivono che ottimizzare solo l'utilizzo può, controintuitivamente, aumentare il consumo di energia. Il loro sistema, EnerTune, usa modelli analitici delle prestazioni e della potenza per modello, incluso il consumo dei modelli colocati su GPU condivise, dentro un algoritmo di bin-packing attento all'energia. Dichiara un consumo energetico da 1,4 a 2,3 volte inferiore e una potenza assorbita da 1,3 a 2,6 volte inferiore rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni.

È un'affermazione sui costi che riguarda una bolletta che la maggior parte delle tabelle sui prezzi per token non mostra.

La robotica sta giocando la stessa partita in un contesto diverso. Mind-1 di MindOn, annunciato il 30 settembre, riduce la latenza di inferenza da 82ms a 32ms, secondo il resoconto della stessa azienda. Il post spiega perché conta: a una velocità dell'end-effector di 3 m/s, 10ms di latenza corrispondono a circa 3cm di movimento, abbastanza da influire su prese precise, inserimenti o manipolazioni ricche di contatto. MindOn indica anche il ritmo dei dati di addestramento, sostenendo che le dimostrazioni teleoperate sono più lente del movimento umano naturale e che i modelli apprendono il ritmo oltre al compito.

Due bollette, due strategie

L'esperienza di Pinecone con un calcolatore di prezzi, raccontata da Gabriel Kogan il 30 settembre, ricorda che il numero di costo che i clienti vedono è di per sé una decisione di prodotto. Il calcolatore produceva stime gonfiate fino a 1.000 volte dopo una sola interpretazione errata, e dava agli utenti una falsa sicurezza che li scoraggiava dal controllare la documentazione. Quando l'azienda ha fatto un test A/B rimuovendolo, i visitatori che non vedevano il calcolatore avevano il 16% in più di probabilità di registrarsi e il 90% in più di contattare l'azienda, senza un aumento dei ticket di supporto sui prezzi. In un sondaggio interno, 7 dipendenti su 10 si aspettavano che la versione con il calcolatore andasse meglio.

Altri due dati stanno fuori dallo stack AI ma inquadrano lo stesso ragionamento sulla sostituzione del capitale al carburante. Transport & Environment, analizzata da CleanTechnica il 29 settembre, dice che i guidatori di auto elettriche pagano meno della metà di quanto pagano i guidatori diesel per chilometro, sulla base di 6,9 L/100 km per il diesel, 20,2 kWh/100 km per l'elettrico a batteria e un prezzo dell'elettricità di 0,343 €/kWh. Antony Froggatt del gruppo ha detto che i guidatori diesel pagano 32 € in più per pieno rispetto all'inizio dell'anno, con circa 16 € di quel margine di raffinazione in più.

Light Reading ha riferito il 30 settembre che StarHub e M1 sono in trattative di fusione a Singapore, con l'entità combinata che eguaglia all'incirca la scala di Singtel, e che 2degrees e OneNZ della Nuova Zelanda hanno proposto di combinare le loro reti radio. L'accordo 5G tra China Telecom e China Unicom, il più grande di condivisione di questo tipo, copre 1.500.000 stazioni base e rivendica 56.000.000.000 di dollari di risparmi in capex. Niente di tutto questo è inferenza AI. Tutto è lo stesso scambio: condividere l'asset fisso, tagliare il costo marginale.

Per gli acquirenti, la divisione pratica è ormai chiara. I prezzi per token calano nelle tabelle pubblicate, e le modalità cache e Batch li riducono ulteriormente. I costi per GPU-ora sono un mercato diverso, e la ricerca di questa settimana suggerisce che gran parte sia ancora sprecata. Né i kernel locali di Magnitude né il query planner di Quail risolvono la cosa. Spostano solo dove sta il contatore.

Commenti 0

Fonti

10
  1. 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  4. 04AI API pricing index - September 2026EN
  5. 05ChatGPT's new plan costs $500 a monthEN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
  8. 08The pricing calculator made people more confused about pricingEN
  9. 09Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  10. 10Singapore, New Zealand operators seek partnerships to cut costsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.