Microsoft lancia modelli vocali in streaming mentre l'hype sui video AI incontra lo scetticismo
Microsoft AI ha rilasciato MAI-Transcribe-2-Streaming e due modelli text-to-speech il 2 ottobre. L'azienda rivendica il primo posto per accuratezza di trascrizione su Artificial Analysis e una latenza di 150 ms per la variante MAI-Voice-2.1-Flash.

Secondo The Decoder, Microsoft AI ha rilasciato MAI-Transcribe-2-Streaming e due modelli text-to-speech il 2 ottobre. Il modello di trascrizione copre 60 lingue e restituisce risultati parziali in poco più di 100 millisecondi.
Non è un generatore di video. È lo strato che determina se un presentatore sintetico suona come una conversazione o come una registrazione. Arriva nella stessa settimana in cui il settore video ha imparato quanto sia difficile l'ultimo miglio.
L'affermazione di realismo più facile da verificare
Tavus ha introdotto Griffin il 1 ottobre, definendolo il primo "Human Interaction Model". The Decoder ha riportato lo studio interno: il 48% dei partecipanti credeva che Griffin fosse una persona reale dopo una videochiamata di un minuto, contro un precedente record del 2%. Un test Nvidia ha assegnato a Griffin 3,83 punti per l'umanità percepita in una conversazione audio-video, contro 3,92 per gli esseri umani reali e 2,80 per il precedente miglior modello AI.
È disponibile solo una preview, Griffin-Lite, per tester selezionati. Una versione completa arriverà una volta risolti i problemi di sicurezza. Tavus è stata fondata nel 2020 e ha raccolto circa 64.000.000 di dollari.
Confronta questi numeri con quelli vocali di Microsoft. MAI-Transcribe-2-Streaming costa 0,54 dollari all'ora di audio a un prezzo introduttivo valido fino alla fine dell'anno. MAI-Voice-2.1 parla 23 lingue con la stessa voce e un accento nativo in ciascuna, secondo Microsoft. La variante Flash costa 15 dollari per milione di caratteri, contro i 22 precedenti. Entrambi i modelli possono clonare una voce da pochi secondi di audio di riferimento. In un test Microsoft, circa la metà di 4.000 partecipanti ha pensato che le voci appartenessero a una persona reale.
I modelli video continuano a uscire, e con loro le domande
Il calendario di rilasci è affollato. L'elenco principale del dossier include FLUX 3 Image, che supporta la generazione fino a 2.000, il posizionamento degli oggetti e l'editing parziale, con una versione open source prevista in poche settimane. Ci sono anche Seedance 2.5 di ByteDance e Kling 4.0 dello spinoff AI di Kuaishou. Nessuno di questi rilasci è dettagliato nei testi di origine forniti, quindi i dettagli sono scarsi. Ciò che è documentato sono gli strumenti adiacenti.
Ideogram ha dichiarato il 1 ottobre che Ideogram 4.5 modificherà solo la parte di un'immagine selezionata dall'utente. I prezzi vanno da 0,8 a 22 centesimi per immagine in quattro livelli di qualità, con risoluzione nativa 2K e un rilascio open-weight promesso. Si tratta di una correzione a un noto problema di fallimento, non di una nuova capacità: le ripetute modifiche su modelli come GPT-Image 2.5 e Nano Banana lasciano ancora artefatti, secondo The Decoder.
Poi c'è il denaro. Dealroom ha riportato il 30 settembre che Luma ha scalato 9.000 GPU in sei ore per il lancio di Dream Machine. Runway è entrata nella robotica con un modello open-weight chiamato Praxis-1, secondo Robotics & Automation News il 1 ottobre. Entrambi si trovano al di fuori dei dieci nuclei di fonte sotto perché il dossier contiene solo i loro titoli.
"I sistemi di storage livellano i prezzi, ma non generano elettricità", ha dichiarato Leonhard Gandhi, project manager per Energy Charts presso Fraunhofer ISE, mentre il suo istituto pubblicava un simulatore per i prezzi dell'energia elettrica in Germania.
Stava parlando di batterie, non di GPU. L'analogia non è perfetta, ma il vincolo ha la stessa forma: la capacità di inferenza è un input fisico. Il dossier mostra cosa succede quando diventa scarsa. Il parlamento della Danimarca ha adottato un piano di emergenza per la rete il 2 ottobre. Sostituisce le connessioni first-come, first-served con quattro categorie di priorità. I data center si trovano nel tier meno prioritario, a meno che non siano legati a una funzione sociale critica.
Nel frattempo lo strato dei modelli continua a frammentarsi. Amazon Web Services ha rilasciato Strands Decider 2B, un modello decisionale open-source, nella stessa settimana in cui OpenAI ha annunciato un'offerta simile, ha riportato TechCrunch il 1 ottobre. Cloudflare ha risposto con Clef e Clef-flash, modelli decisionali open-weight che, a detta dell'azienda, battono TypeSafe's Jev su tre dei quattro benchmark di TypeSafe stesso. Il costo è di 0,24 dollari per milione di token, contro 0,042 di Jev. Cloudflare ha autocertificato quei punteggi e non sono stati riprodotti sull'indice ufficiale, come ha notato The Register.
Nessuno di questo risolve la domanda che uno spettatore pone nei primi due secondi di un clip sintetico: è una persona? Tavus ha un numero per questo. È il 48%, in una chiamata di un minuto, in uno studio condotto dall'azienda stessa.
Fonti
15- 01Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 02Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute callEN
- 03Ideogram says its new model can edit part of an image without messing up the restEN
- 04Amazon releases its own Jev clone as decision models flood the webEN
- 05Cloudflare tries to outplay Jev with open-weight Clef modelsEN
- 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
- 07Fraunhofer ISE releases electricity price simulatorEN
- 08Denmark approves new grid connection prioritization modelEN
- 09Google releases Gemini 4 Argon, called its most powerful model yetEN
- 10Google rolls out new Gemini AI model but restricts access over safety concernsEN
- 11OpenAI scraps release of new model over safety concerns in internal testingEN
- 12OpenAI says planned GPT-6.1 is too insecure to releaseEN
- 13OpenAI abandons plan to release upcoming model as safety concerns escalateEN
- 14The NHL Is Releasing Its Own 'Hot' Fanfic. Romance Lovers Hate ItEN
- 15The Tesla Model 3 Gets A Range Bump And A New Screen In The U.S.EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.