Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Il piano ChatGPT da 500 dollari di OpenAI arriva pochi giorni dopo il prezzo mediano di 1,32 dollari per milione di token in input

OpenAI ha annunciato martedì al DevDay un abbonamento ChatGPT da 500 dollari al mese. Nella stessa settimana un'istantanea di fine mese ha fissato a 1,32 dollari il prezzo mediano di listino per un milione di token in input, su 81 voci pubbliche.

IA e modelliAnalisiGiulia FerrariPubblicato: 30 settembre 20265 min di letturaFonti 9
Il piano ChatGPT da 500 dollari di OpenAI arriva pochi giorni dopo il prezzo mediano di 1,32 dollari per milione di token in input

OpenAI ha usato il DevDay di martedì per annunciare un nuovo livello di abbonamento al vertice, Pro 500, a 500 dollari al mese, secondo Business Insider. Sono 300 dollari in più rispetto al piano più alto precedente dell'azienda. Per una singola licenza fanno 6.000 dollari l'anno.

Il livello include l'accesso a quello che OpenAI chiama calcolo "Ultrafast" per GPT-6 Astra in ChatGPT Work e Codex. Business Insider riferisce che l'opzione promette un aumento di velocità di 8 volte dentro Codex e comporta il massimo utilizzo incluso offerto dall'azienda. Lo stesso articolo dice che OpenAI riapre il suo vecchio piano Pro da 200 dollari al mese, sospeso il 10 settembre, ma taglia a metà la quota di calcolo: la quota scende a 10 volte il livello Plus da 20 dollari, da un precedente multiplo di 20 volte, e i messaggi settimanali in chat su GPT-6 Pro calano da 200 a 100.

Thibault Sottiaux, responsabile dell'ingegneria di Codex in OpenAI, ha scritto lunedì su X che con i cambiamenti si spendono in API la metà dei dollari rispetto al piano precedente. Business Insider lo cita direttamente. Nessun'altra testata in questo dossier conferma i dettagli sui prezzi, e OpenAI non ha pubblicato un listino che questo articolo potesse verificare in modo indipendente.

La tempistica conta. Un'istantanea di settembre dei prezzi API pubblicati mostra che il prezzo di listino minimo è lontano dai 500 dollari al mese per la maggior parte dei carichi di lavoro. L'AI API Pricing Index di AICostBudget, congelato al 30 settembre 2026 UTC, copre 81 voci di prezzo pubbliche su 11 fornitori. Su 69 voci con un valore scalare corrente per i token in input, l'intervallo osservato va da 0,10 a 30 dollari per milione di token. Sulle stesse 69 voci per i token in output, l'intervallo va da 0,10 a 180 dollari per milione.

Sconti, caching e prezzo di listino

Le mediane principali dell'indice sono 1,32 dollari per milione di token in input e 6 dollari per milione di token in output, con un rapporto mediano output-input di 5,0 volte. Sono prezzi di listino, e l'indice precisa che i prezzi di listino non sono quelli che paga la maggior parte degli acquirenti. Su 58 voci comparabili, lo sconto osservato sull'input in cache va dal 75% al 98%, con una mediana del 90%. Su 44 voci compatibili con Batch, lo sconto osservato sull'input in batch va dal 20% al 50%, con una mediana del 50%.

Questo divario è tutto l'argomento a favore dei progetti di motori di inferenza e ottimizzazione delle query comparsi nell'ultima settimana. Se un carico di lavoro riesce a spostare i prefissi ripetuti in cache e i lavori in blocco in batch, il prezzo effettivo per token scende ben sotto la mediana. Se non ci riesce, il prezzo di listino è la bolletta.

Due progetti pubblicati il 30 settembre attaccano il problema dai due estremi dello stack. Sul lato database, il lavoro QUAIL del Full Stack Data Lab, pubblicato il 30 settembre, ottimizza insieme la pianificazione delle query SQL e l'inferenza LLM. La sua query di benchmark BIO-4 gira su oltre 5.000 referti medici lunghi e 4.144 termini di reazione, con la lista delle reazioni usata due volte in due join. Gli autori sostengono che mandare milioni di chiamate correlate al modello a un motore generalista come vLLM, come richieste separate, comporti un costo elevato: ogni prompt viene renderizzato e servito come richiesta di inferenza indipendente.

Il testo di Modal sullo stesso sistema, sempre datato 30 settembre, ci mette i numeri. Quail elabora oltre un miliardo di token al minuto per GPU H100 su una query con più join. Secondo Modal è oltre 10 volte più veloce della sua baseline vLLM sullo stesso hardware, e costa meno di 6 centesimi per miliardo di token su Modal. Sul benchmark AI-SQL appena rilasciato, Modal riporta Quail a 1,84 volte più veloce di vLLM, con media geometrica sui task, incluse due query progettate dagli autori per mostrare dove l'inferenza AI-SQL ha ancora bisogno di lavoro.

La media geometrica di 1,84 volte e il dato di 10 volte su una singola query vengono dallo stesso team e non vanno letti come la stessa misura.

Kernel locali e latenza dei robot

Sul lato client, Magnitude, azienda di Y Combinator S25, ha lanciato il 30 settembre un motore di inferenza open source che compila e ottimizza i suoi kernel sul dispositivo dell'utente prima che il modello giri. Il suo README su GitHub sostiene che i modelli aperti girano fino a 2 volte più veloci di llama.cpp, con il 92% in più di velocità di decodifica su Metal e il 19% su CUDA, e il 27% in meno di memoria per agente. Supporta Apple Silicon, NVIDIA, AMD o solo CPU. Quei numeri sono del progetto stesso e non sono stati riprodotti in modo indipendente in questo dossier.

L'inferenza sui robot insegue lo stesso orologio. MindOn ha presentato Mind-1 il 30 settembre, sostenendo di ridurre la latenza di inferenza dei robot da 82ms a 32ms. L'azienda osserva che a una velocità dell'end-effector di 3 m/s, 10 ms di latenza corrispondono a circa 3 cm di spostamento, abbastanza da influire su presa precisa, inserimento o manipolazione ricca di contatti. Le sue stime di velocità coprono la logistica e gli ambienti umani quotidiani e vengono dai test interni di MindOn.

Il lavoro accademico indica un costo che le metriche di utilizzo nascondono. Un articolo presentato a SOSP '26 il 28 settembre da Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar descrive EnerTune, un sistema di serving che modella la potenza per modello e il consumo dei modelli colocati su GPU condivise. Gli autori riportano riduzioni di energia da 1,4 a 2,3 volte e riduzioni di potenza da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni. La loro tesi è che ottimizzare solo l'utilizzo può far salire il consumo energetico, e che profilare ogni configurazione su larga scala costa troppa energia per essere praticabile.

Dove finiscano davvero i soldi è ancora conteso. Light Reading ha riferito il 30 settembre che StarHub e M1 sono in trattative di fusione a Singapore, e che 2degrees e OneNZ in Nuova Zelanda hanno proposto di unire le loro reti radio. StarHub avverte che le negoziazioni proseguono. Light Reading osserva che StarHub e M1 insieme sarebbero all'incirca della scala di Singtel, e che Singtel avrebbe detenuto a giugno una quota mobile del 43%, con M1 al 22%, StarHub al 21% e Simba al 14%.

Una lezione sui prezzi della stessa settimana non ha niente a che fare con le GPU. Pinecone ha rimosso il suo calcolatore di prezzi dopo aver scoperto che un singolo input interpretato male poteva gonfiare una stima fino a 1.000 volte, secondo un resoconto in prima persona di Gkogan pubblicato il 30 settembre. I visitatori che non vedevano il calcolatore avevano il 16% in più di probabilità di registrarsi e il 90% in più di contattare l'azienda, senza alcun aumento dei ticket di supporto sui prezzi. Sette dipendenti su dieci si aspettavano che vincesse la versione con il calcolatore.

Commenti 0

Fonti

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02AI API Pricing Index - September 2026EN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  6. 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
  7. 07Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09The pricing calculator made people more confused about pricingEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.