Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Si moltiplicano gli strumenti sui costi di inferenza, mentre i prezzi delle GPU restano opachi

Un calcolatore che gira nel browser, pubblicato il 23 settembre, confronta i costi di inferenza di 27 modelli. Il suo stesso autore avverte però che il risultato è una stima di pianificazione, non un preventivo di un fornitore. Pochi giorni dopo, un altro benchmark ha messo sotto la stessa lente il costo di far girare un modello per un'ora.

IA e modelliAnalisiGiulia FerrariPubblicato: 28 settembre 20263 min di letturaFonti 5
Si moltiplicano gli strumenti sui costi di inferenza, mentre i prezzi delle GPU restano opachi

L'ultimo arrivato nella discussione sui costi di inferenza non è un annuncio di listino. È un calcolatore. Il 23 settembre Flavio Copes ha pubblicato un Inference Cost Calculator che mette a confronto 27 modelli di OpenAI, Anthropic, Google, xAI, Mistral, OpenRouter e Workers AI partendo dagli stessi presupposti.

Si impostano gli utenti attivi giornalieri, le chiamate per utente, i token di input e di output per chiamata e un tasso opzionale di hit della prompt cache. Il tool restituisce una bolletta mensile. Avverte anche che i valori vengono dai prezzi API pubblicati e ignorano i prezzi batch, gli sconti aziendali, i supplementi per immagini o tool e qualsiasi livello di caching costruito in casa.

Quella avvertenza conta più della classifica.

Il benchmark che dà un prezzo a un'ora di ragionamento

Il 26 settembre StarSkirmish ha pubblicato un confronto di costi di altro tipo. Il benchmark dà a ogni LLM un'ora di tempo per scrivere in C++ un bot Protoss per StarCraft: Brood War. Poi fa giocare i bot l'uno contro l'altro e contro avversari scritti da esseri umani. Il campo è di 50 bot LLM provenienti da 10 modelli, più 3 bot dimostrativi e 9 bot competitivi scritti da umani, per 62 partecipanti, eseguiti su sandbox Prime Intellect.

Secondo la relazione del progetto, GPT-6 Astra e Claude Opus 5.5 sono di fatto appaiati in testa. Con loro, GPT-6 Sol sta nettamente un gradino sopra gli altri. Il benchmark mette anche in grafico il punteggio contro il costo API medio di una singola esecuzione da un'ora su scala logaritmica, e afferma che GPT-6 Sol offre un rapporto qualità-prezzo particolarmente buono in quel confronto.

Qui il rapporto è tra costo e capacità, non tra costo e token. Il progetto ammette anche un limite: gli autori dicono che i modelli di ragionamento allo stato dell'arte traggono ormai un beneficio significativo da periodi di ragionamento più lunghi di un'ora, e che sono previste versioni a esecuzione più lunga.

Perché è difficile fidarsi dei numeri pubblici

Nessuna delle due fonti dà il prezzo di una GPU. Per quello il dossier ha un'indagine pubblicata il 20 settembre da Nexlab, che confronta orchestratori self-hosted tra cui LocalAI, exo, GPUStack, vLLM, Ollama, Xinference e CoderAI. I conteggi delle stelle sono stati presi dall'API di GitHub il 20 settembre. L'autore dichiara apertamente che dove una funzione non è stata confermata la tabella lo dice, invece di tirare a indovinare.

Le distinzioni utili dell'indagine non riguardano affatto il prezzo. Separa se un modello può estendersi su più di una macchina, se un turno successivo viene instradato dove si trovano già la sua cache KV o di prefisso, e se il server può affittare una GPU da solo. vLLM, con 92.000 stelle in quell'istantanea, supporta il parallelismo tensoriale e di pipeline su Ray e il prefix caching per istanza. Ollama, con 181.000 stelle, è una macchina e un modello alla volta, senza alcuna storia di cluster oltre al round-robin di più URL dietro Open WebUI.

È l'hardware, non il software, a fare la spesa. Il mercato fotovoltaico brasiliano non è una storia di AI, ma pv magazine ha riferito il 26 settembre che i prezzi medi dei sistemi fotovoltaici nel paese sono saliti del 7% tra gennaio e giugno 2026 per impianti fino a 300 kW, secondo lo studio Distributed Energy Solutions di Greener. I costi dei kit per sistemi da 4 kW sono aumentati del 18,3%, da BRL 1,42/W a BRL 1,68/W.

Materia prima diversa, stesso problema: il numero in evidenza si muove perché si muovono i componenti.

Cosa dice la ricerca sul lato dell'output

Un altro tassello del quadro dei costi sta dal lato della domanda. Un paper inviato ad arXiv il 14 settembre e rivisto il 17 settembre, SlopShape, descrive uno strumento con 214 feature che rileva i contenuti web commerciali generati dall'AI dalle sole firme strutturali. Applicato da un LLM e validato contro annotazioni umane, ha raggiunto 98,0 di macro-F1 su aziende tenute fuori dal campione, e 98,1 quando ogni post AI è stato riscritto dal suo stesso modello. L'autore è Jochen Madler di Sitefire.

Un'inferenza più economica produce più testo. Rilevare quel testo è ormai un compito misurabile con un'accuratezza pubblicata, che è a sua volta una voce di costo infrastrutturale.

Nessuna di queste fonti concorda su quanto dovrebbe costare l'inferenza, perché nessuna misura la stessa cosa. Il calcolatore misura una bolletta ipotetica. Il benchmark misura la capacità per ora di spesa API. L'indagine sugli orchestratori misura funzioni, non fatture. Qualsiasi cifra presa da sola va trattata come un'ipotesi di partenza.

Commenti 0

Fonti

5
  1. 01Inference Cost CalculatorEN
  2. 02StarSkirmish BenchEN
  3. 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN
  4. 04PV system costs increase by 7% in Brazil in H1EN
  5. 05SlopShape: Identifying AI-Generated Commercial Web ContentEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.