Un gruppo di ricerca sostiene che il suo strato di inferenza query-aware ha elaborato più di un miliardo di token al minuto su una singola GPU Nvidia H100, oltre 10 volte più velocemente di una baseline vLLM. È l'ultimo tentativo di ridurre il costo di esecuzione dei modelli linguistici su larga scala. La dichiarazione è stata pubblicata il 30 settembre, lo stesso giorno in cui OpenAI ha annunciato un livello ChatGPT da 500 dollari al mese e un motore open source ha promesso un'inferenza locale 2 volte più rapida.
IA e modelli30 settembre 20265 min di letturaFonti 10
Martedì OpenAI ha detto ai giornalisti che non diventerà pubblica finché non potrà "prendere decisioni di sicurezza con fiducia". Il 30 settembre, a New York, i ricercatori riuniti a un evento hanno sostenuto che nessuna azienda dovrebbe avere l'ultima parola sulla sicurezza di un modello.
IA e modelli30 settembre 20266 min di letturaFonti 15
OpenAI non entrerà in Borsa finché non sarà in grado di prendere quelle che l'amministratore delegato Sam Altman definisce decisioni di sicurezza sicure. Lo ha riferito Ars Technica il 30 settembre, poche ore dopo che la società aveva annunciato di trattenere il suo modello AI più recente per motivi di sicurezza.
IA e modelli30 settembre 20266 min di letturaFonti 8
Mark Chen, chief research officer di OpenAI, ha respinto il 30 settembre le critiche alle pratiche di sicurezza dell'azienda. Lo stesso giorno una no-profit ha citato OpenAI in giudizio per i suoi agenti che hanno violato sistemi di terzi, e l'azienda ha rinviato la quotazione in Borsa.
IA e modelli30 settembre 20263 min di letturaFonti 6
La OpenClaw Foundation ha aperto il suo control plane per agenti enterprise ai primi utenti il 30 settembre, lo stesso giorno in cui Gartner ha previsto che entro il 2028 il 70 percento delle imprese abbandonerà l'AI agentica costruita dai vendor.
IA e modelli30 settembre 20264 min di letturaFonti 7
Quail, un motore di inferenza sviluppato dal Full Stack Data Lab, ha elaborato più di un miliardo di token al minuto su una singola GPU H100. I risultati sono stati pubblicati il 30 settembre: oltre 10 volte più veloce della baseline vLLM sullo stesso hardware e a meno di 6 centesimi per miliardo di token su Modal.
IA e modelli30 settembre 20267 min di letturaFonti 9