Microsoft publie des modèles vocaux en streaming alors que l'engouement pour la vidéo IA se heurte au scepticisme
Microsoft AI a lancé MAI-Transcribe-2-Streaming et deux modèles de synthèse vocale le 2 octobre. L'entreprise revendique la première place en précision de transcription sur Artificial Analysis et une latence de 150 ms pour la variante MAI-Voice-2.1-Flash.

Microsoft AI a publié MAI-Transcribe-2-Streaming et deux modèles de synthèse vocale le 2 octobre, selon The Decoder. Le modèle de transcription couvre 60 langues et renvoie des résultats partiels en un peu plus de 100 millisecondes.
Ce n'est pas un générateur vidéo. C'est la couche qui détermine si un présentateur synthétique donne l'impression de converser ou d'être enregistré. Elle arrive la même semaine où le volet vidéo de l'industrie a appris à ses dépens à quel point la dernière étape est difficile.
La prétention au réalisme la plus facile à vérifier
Tavus a présenté Griffin le 1er octobre, le qualifiant de premier « modèle d'interaction humaine ». The Decoder a rapporté l'étude interne de l'entreprise : 48 % des participants ont cru que Griffin était une vraie personne après un appel vidéo d'une minute, contre un meilleur score précédent de 2 %. Selon Tavus, un test Nvidia a attribué à Griffin 3,83 points pour le sentiment d'humanité dans une conversation audio-vidéo, contre 3,92 pour des humains réels et 2,80 pour le meilleur modèle IA précédent.
Seule une version d'aperçu, Griffin-Lite, est disponible pour des testeurs sélectionnés. Une version complète est promise une fois les questions de sécurité réglées. Tavus a été fondée en 2020 et a levé environ 64 000 000 dollars.
Comparez cela avec les chiffres vocaux de Microsoft. MAI-Transcribe-2-Streaming coûte 0,54 dollar par heure d'audio au prix introductif jusqu'à la fin de l'année. MAI-Voice-2.1 parle 23 langues avec la même voix et un accent natif pour chacune, selon Microsoft. La variante Flash coûte 15 dollars par million de caractères au lieu de 22. Les deux peuvent cloner une voix à partir de quelques secondes d'audio de référence. Dans un test Microsoft, environ la moitié des 4 000 participants a pensé que les voix appartenaient à une vraie personne.
Les modèles vidéo continuent de sortir, tout comme les questions
L'agenda de publication est chargé. La liste principale du dossier comprend FLUX 3 Image, décrit comme prenant en charge la génération jusqu'à 2 000 pixels, le positionnement des sujets et l'édition partielle. Une version open source est attendue dans quelques semaines. On y trouve aussi Seedance 2.5 de ByteDance et Kling 4.0 de la spin-off IA de Kuaishou. Aucune de ces sorties n'est détaillée dans les textes sources fournis ici, les spécificités sont donc minces. Ce qui est documenté, c'est l'outillage adjacent.
Ideogram a annoncé le 1er octobre qu'Ideogram 4.5 ne touchera que la partie de l'image sélectionnée par l'utilisateur. Le modèle offre quatre niveaux de qualité de 0,8 à 22 cents par image et une résolution native 2K, avec une version open-weight promise. C'est une correction d'un mode d'échec connu plutôt qu'une nouvelle capacité : les éditions répétées sur des modèles comme GPT-Image 2.5 et Nano Banana laissent encore des artefacts, selon The Decoder.
Il y a aussi l'argent. Dealroom a rapporté le 30 septembre que Luma a mis à l'échelle 9 000 GPU en six heures pour le lancement de Dream Machine. Runway s'est tourné vers la robotique avec un modèle open-weight appelé Praxis-1, selon Robotics & Automation News le 1er octobre. Les deux sont en dehors du noyau des dix sources ci-dessous car le dossier ne contient que leurs titres.
« Les systèmes de stockage lissent les prix, mais ils ne génèrent pas d'électricité », a déclaré Leonhard Gandhi, responsable de projet pour Energy Charts chez Fraunhofer ISE, alors que son institut publiait un simulateur pour les prix de l'électricité à un jour en Allemagne.
Il parlait des batteries, pas des GPU. L'analogie n'est pas parfaite, mais la contrainte a la même forme : la capacité d'inférence est une entrée physique. Le dossier montre ce qui se passe quand elle devient rare. Le parlement danois a adopté un plan d'urgence pour le réseau le 2 octobre. Il remplace les connexions au premier arrivé, premier servi par quatre catégories de priorité. Les centres de données se situent dans le rang le moins prioritaire, sauf s'ils sont liés à une fonction sociétale critique.
Pendant ce temps, la couche des modèles continue de se fragmenter. Amazon Web Services a publié Strands Decider 2B, un modèle de décision open source, la même semaine où OpenAI a annoncé une offre similaire, a rapporté TechCrunch le 1er octobre. Cloudflare a répondu avec Clef et Clef-flash, des modèles de décision open-weight qu'il dit battre Jev de TypeSafe sur trois des quatre benchmarks de TypeSafe. Le coût est de 0,24 dollar par million de tokens contre 0,042 dollar pour Jev. Cloudflare a auto-déclaré ces scores et ils n'ont pas été reproduits sur l'indice officiel, comme l'a noté The Register.
Aucun de cela ne règle la question qu'un spectateur se pose dans les deux premières secondes d'un clip synthétique : est-ce une personne. Tavus a un chiffre pour cela. C'est 48 %, sur un appel d'une minute, dans une étude que l'entreprise a menée elle-même.
Sources
15- 01Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 02Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute callEN
- 03Ideogram says its new model can edit part of an image without messing up the restEN
- 04Amazon releases its own Jev clone as decision models flood the webEN
- 05Cloudflare tries to outplay Jev with open-weight Clef modelsEN
- 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
- 07Fraunhofer ISE releases electricity price simulatorEN
- 08Denmark approves new grid connection prioritization modelEN
- 09Google releases Gemini 4 Argon, called its most powerful model yetEN
- 10Google rolls out new Gemini AI model but restricts access over safety concernsEN
- 11OpenAI scraps release of new model over safety concerns in internal testingEN
- 12OpenAI says planned GPT-6.1 is too insecure to releaseEN
- 13OpenAI abandons plan to release upcoming model as safety concerns escalateEN
- 14The NHL Is Releasing Its Own 'Hot' Fanfic. Romance Lovers Hate ItEN
- 15The Tesla Model 3 Gets A Range Bump And A New Screen In The U.S.EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.