Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Costi di inferenza divisi: piano ChatGPT da 500 dollari, motori aperti 2 volte più veloci, 6 centesimi per miliardo di token

Il 29 settembre OpenAI ha aperto un piano ChatGPT Pro da 500 dollari al mese, il più caro finora e 300 dollari sopra il precedente livello massimo, secondo Business Insider, mentre gli stack di inferenza aperti e più economici cercano di battere il prezzo.

IA e modelliNotiziaGiulia FerrariPubblicato: 30 settembre 20265 min di letturaFonti 9
Costi di inferenza divisi: piano ChatGPT da 500 dollari, motori aperti 2 volte più veloci, 6 centesimi per miliardo di token

Il nuovo piano, annunciato al DevDay di martedì, include l'accesso al calcolo "Ultrafast" per GPT-6 Astra in ChatGPT Work e Codex. Business Insider ha riportato che per quella modalità è promesso un aumento di velocità di 8 volte in Codex. Lo stesso articolo dice che OpenAI riapre il piano Pro da 200 dollari al mese, sospeso il 10 settembre, ma dimezza la quota di calcolo a 10 volte il livello Plus da 20 dollari invece di 20 volte, e riduce i messaggi di chat di GPT-6 Pro da 200 a 100 a settimana.

Thibault Sottiaux, responsabile ingegneristico di Codex, ha scritto lunedì in un post su X che i cambiamenti si traducono in metà della spesa in dollari sulle API rispetto al piano precedente, secondo Business Insider.

"Volevo assicurarmi di condividere questo cambiamento in anticipo, così potete capirlo prima che vi inondiamo di buone notizie", ha scritto.

Questo è il vertice del mercato. La base si muove più in fretta.

Motori aperti e kernel che si ottimizzano da soli

Il 30 settembre Magnitude, sostenuta da YC, ha pubblicato un motore di inferenza open source che compila e ottimizza i kernel sull'hardware dell'utente prima che il modello giri. L'azienda sostiene che i modelli aperti vanno fino a 2 volte più veloci di llama.cpp. Il README su GitHub indica un decode più rapido del 92% sul backend Metal di Apple Silicon e del 19% su CUDA, oltre al 27% in meno di memoria per agente e cache di prefisso condivise per sessioni concorrenti.

Esce come app desktop con licenza Apache 2.0, supporta Apple Silicon, NVIDIA, AMD o solo CPU, e si collega a Pi, OpenCode, Hermes, Codex e altri agenti. Due ore prima, Modal e il Full Stack Data Lab hanno pubblicato un motore congiunto SQL più inferenza chiamato Quail. Il testo di Modal sostiene che Quail supera il miliardo di token elaborati al minuto su una sola GPU H100 in una query con più join, più di 10 volte la sua baseline vLLM sullo stesso hardware, a meno di 6 centesimi per miliardo di token su Modal. Nel nuovo benchmark AI-SQL del team, la media geometrica dello speedup rispetto a vLLM è 1,84 volte, e il post nomina due query pensate per mostrare dove l'approccio è ancora carente.

Gli autori dicono chiaramente che i motori generici hanno la forma sbagliata per questo carico di lavoro. Nel post del Full Stack Data Lab, Shreya Shankar, Charles Frye, Fergus Finn, Arnav Dhariya, Joseph Barrow e Meryem Arik scrivono che mandare milioni di chiamate correlate al modello a un motore come vLLM come richieste separate comporta un costo elevato. La loro query di esempio, BIO-4 nel benchmark QUAIL-B, filtra 5.000 referti medici lunghi contro 4.144 termini di reazione usati due volte. Un'esecuzione ingenua trasforma così una singola istruzione SQL in un numero molto grande di chiamate al modello.

Il prezzo minimo è pubblicato, e non è piatto

L'indice dei prezzi di settembre di AICostBudget, congelato al taglio UTC del 2026-09-30, copre 81 record pubblici su 11 fornitori. Fissa il prezzo mediano di input a 1,32 dollari per milione di token e quello di output a 6 dollari, con l'output prezzato 5,0 volte l'input alla mediana sui 69 record che riportano entrambi i numeri. Gli intervalli osservati vanno da 0,10 a 30 dollari per milione di token in input e da 0,10 a 180 dollari per milione in output.

Lo stesso dataset fornisce le mediane per fornitore: OpenAI a 2 dollari in input e 11 in output su 18 record, Google Gemini a 0,75 e 4,125 su 14, Anthropic a 5 e 25 su 13, xAI a 1,25 e 2,5 su nove, Mistral AI a 0,20 e 0,60 su sette, DeepSeek a 0,30 e 1,2 su tre, e Moonshot AI a 0,95 e 4 su tre. Su 58 record comparabili con input in cache lo sconto mediano è del 90%, e su 44 record con prezzi batch lo sconto batch mediano è del 50%. Un confronto che ignora l'una o l'altra modalità confronta listini, non fatture.

Sull'hardware la questione diventa più difficile da chiudere. EnerTune, un paper di Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar a SOSP '26 del 28 settembre, sostiene che il multiplexing delle GPU fatto solo per alzare l'utilizzo può aumentare il consumo di energia. Gli autori riportano che il loro sistema di bin-packing attento all'energia rispetta gli SLO di prestazioni e riduce il consumo energetico da 1,4 a 2,3 volte e la potenza assorbita da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte.

Non tutte le notizie sui costi di questa settimana riguardano i data centre. I dati di Transport & Environment analizzati il 29 settembre mettono i costi di esercizio delle auto elettriche a meno della metà del diesel per chilometro, sulla base di 6,9 litri per 100 km per il diesel e 20,2 kWh per 100 km per l'elettrico a batteria con un prezzo dell'elettricità di 0,343 EUR per kWh. I guidatori diesel pagano 32 EUR in più per un serbatoio da 50 litri rispetto all'inizio dell'anno, circa 16 EUR dei quali di margine di raffineria aggiuntivo, secondo le stime della BCE citate da CleanTechnica.

Due lezioni della settimana stanno fuori dall'AI. Pinecone ha rimosso il calcolatore dei prezzi dalla sua pagina dei prezzi dopo che un test A/B ha rilevato che i visitatori che non lo vedevano avevano il 16% in più di probabilità di iscriversi e il 90% in più di contattare l'azienda, senza un aumento dei ticket di supporto sui prezzi, secondo il fondatore Greg Kogan. E nelle telecomunicazioni, Light Reading ha riportato il 30 settembre che StarHub e M1 di Singapore sono in trattative di fusione, mentre in Nuova Zelanda 2degrees e OneNZ hanno proposto di unire le loro reti di accesso radio.

Il filo conduttore: quando un'unità di lavoro diventa abbastanza economica, gli acquirenti smettono di leggere il calcolatore e iniziano a misurare la fattura.

Commenti 0

Fonti

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05AI API pricing index - September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08The pricing calculator made people more confused about pricingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.