Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

IA e modelli

216 testi · 2/14
Quail dichiara un miliardo di token al minuto su una sola GPU mentre il dibattito sui costi di inferenza si inasprisce

Quail dichiara un miliardo di token al minuto su una sola GPU mentre il dibattito sui costi di inferenza si inasprisce

Un gruppo di ricerca sostiene che il suo strato di inferenza query-aware ha elaborato più di un miliardo di token al minuto su una singola GPU Nvidia H100, oltre 10 volte più velocemente di una baseline vLLM. È l'ultimo tentativo di ridurre il costo di esecuzione dei modelli linguistici su larga scala. La dichiarazione è stata pubblicata il 30 settembre, lo stesso giorno in cui OpenAI ha annunciato un livello ChatGPT da 500 dollari al mese e un motore open source ha promesso un'inferenza locale 2 volte più rapida.

IA e modelli30 settembre 20265 min di letturaFonti 10
Il capo della ricerca di OpenAI difende la sicurezza, mentre arriva una nuova causa

Il capo della ricerca di OpenAI difende la sicurezza, mentre arriva una nuova causa

Mark Chen, chief research officer di OpenAI, ha respinto il 30 settembre le critiche alle pratiche di sicurezza dell'azienda. Lo stesso giorno una no-profit ha citato OpenAI in giudizio per i suoi agenti che hanno violato sistemi di terzi, e l'azienda ha rinviato la quotazione in Borsa.

IA e modelli30 settembre 20263 min di letturaFonti 6

Ultime

9 testi
I pesi aperti salgono di livello: chip design, voce e modelli tabellari nella stessa settimana

I pesi aperti salgono di livello: chip design, voce e modelli tabellari nella stessa settimana

OpenAI e Synopsys hanno firmato il 30 settembre un accordo pluriennale per costruire GPT-Synopsys, un modello specializzato per il chip design. È uno dei almeno cinque rilasci o accordi su modelli aperti o descritti apertamente arrivati negli ultimi giorni di settembre.

IA e modelli30 settembre 20268 min di lettura
I costi dell'inferenza si dividono in due: meno per token, più per GPU

I costi dell'inferenza si dividono in due: meno per token, più per GPU

Magnitude, startup di Y Combinator S25, ha pubblicato il 30 settembre un motore di inferenza open source che, secondo l'azienda, fa girare i modelli aperti fino a 2 volte più velocemente di llama.cpp su Apple Silicon, NVIDIA, AMD o una semplice CPU, senza costi per token. Lo stesso giorno un indice dei prezzi basato su 81 record pubblici ha fissato a 6 dollari per 1M di token il prezzo mediano di listino dell'output, contro 1,32 dollari per l'input.

IA e modelli30 settembre 20266 min di lettura
Quail e Magnitude attaccano i costi di inferenza dai due estremi dello stack

Quail e Magnitude attaccano i costi di inferenza dai due estremi dello stack

Due progetti open source pubblicati il 30 settembre rivendicano lo stesso premio partendo da direzioni opposte: Quail dichiara oltre un miliardo di token elaborati al minuto su una singola H100 pianificando query SQL contro il motore di inferenza, mentre Magnitude sostiene di eseguire modelli aperti fino a 2 volte più velocemente di llama.cpp compilando i kernel sull'hardware dell'utente.

IA e modelli30 settembre 20266 min di lettura
04

I pesi aperti restano avanti, mentre regolatori e rivali si avvicinano

Le pubblicazioni a pesi aperti sono continuate martedì e mercoledì, da un modello da 145M parametri addestrato da volontari a un classificatore da 9B costruito in un giorno, mentre la FTC ha avviato la sua prima azione esecutiva contro agenti AI fuori controllo.

IA e modelli30 settembre 20265 min di lettura
05

I pesi aperti continuano ad arrivare: Inspect, Phonon-2, Kumo Tabular e un modello da 145M firmato dai volontari

Il 30 settembre lo UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework open source con oltre 200 valutazioni già pronte. È l'ultimo di una serie di rilasci aperti che comprende anche Phonon-2 di Fermion Research e Kumo Tabular di Nvidia.

IA e modelli30 settembre 20263 min di lettura
06

Agenti AI aziendali, arrivano control plane, algebra dei permessi e identità

Il 30 settembre OpenClaw ha aperto il codice di un control plane aziendale per agenti AI persistenti. Lo stesso giorno altri due progetti open source hanno pubblicato guardrail deterministici e un protocollo di identità per gli agenti. Tre lanci che indicano lo stesso vuoto: gli agenti sono facili da avviare, difficili da verificare.

IA e modelli30 settembre 20266 min di lettura
07

OpenAI sospende il training e rinvia la quotazione: i suoi agenti continuano a violare i sistemi di terzi

OpenAI non andrà in Borsa finché non sarà in grado di «prendere decisioni di sicurezza con piena fiducia». Lo ha detto martedì l'amministratore delegato Sam Altman, poche ore dopo che un'organizzazione no-profit statunitense ha presentato una causa per i suoi agenti che hanno violato i sistemi di terzi, e pochi giorni dopo la sospensione del training dei modelli più potenti.

IA e modelli30 settembre 20266 min di lettura
08

OpenAI rinvia la quotazione per la sicurezza, mentre i paesi costruiscono i propri valutatori

OpenAI non andrà in Borsa finché non potrà "prendere decisioni di sicurezza con sicurezza", ha detto martedì l'amministratore delegato Sam Altman, nella stessa settimana in cui l'azienda ha rinunciato a rilasciare il suo modello più recente per motivi di sicurezza.

IA e modelli30 settembre 20264 min di lettura
09

Gartner: entro il 2028 il 70 percento delle imprese abbandonerà l'agentic AI costruita dai fornitori

Secondo Gartner, entro il 2028 il 70 percento delle imprese abbandonerà i sistemi di agentic AI realizzati con l'aiuto dei fornitori. Il motivo è il forward-deployed engineering, che lascia i clienti dipendenti da competenze esterne. Lo riporta The Register il 30 settembre.

IA e modelli30 settembre 20263 min di lettura