Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Microsoft liefert Streaming-Sprachmodelle, während KI-Video-Hype auf Skeptiker trifft

Microsoft AI veröffentlichte am 2. Oktober MAI-Transcribe-2-Streaming und zwei Text-to-Speech-Modelle. Das Unternehmen behauptet den ersten Platz bei der Transkriptionsgenauigkeit auf Artificial Analysis und nennt eine Latenz von 150 ms für die MAI-Voice-2.1-Flash-Variante.

KI & ModelleNachrichtKatrin HoffmannVeröffentlicht: 2. Oktober 20264 Min. LesezeitQuellen 15
Microsoft liefert Streaming-Sprachmodelle, während KI-Video-Hype auf Skeptiker trifft

Laut The Decoder, das den Start berichtete, veröffentlichte Microsoft AI am 2. Oktober MAI-Transcribe-2-Streaming sowie zwei Text-to-Speech-Modelle. Microsoft gibt an, das Transkriptionsmodell decke 60 Sprachen ab und liefere Teilergebnisse in knapp über 100 Millisekunden.

Das ist kein Videogenerator. Aber es ist die Ebene, die entscheidet, ob ein synthetischer Präsentator wie ein Gespräch oder wie eine Aufnahme wirkt. Und sie kommt in derselben Woche, in der die Videoseite der Branche eine Lektion erteilt bekam, wie schwer die letzte Meile ist.

Der Realitätsanspruch, der am leichtesten zu prüfen ist

Tavus stellte am 1. Oktober Griffin vor und nannte es das erste „Human Interaction Model“. The Decoder berichtete über die eigene Studie des Unternehmens: 48 Prozent der Teilnehmer hielten Griffin nach einem einminütigen Videoanruf für einen echten Menschen, im Vergleich zu einem bisherigen Bestwert von 2 Prozent. Tavus berichtet, dass ein Nvidia-Test Griffin 3,83 Punkte für den menschlichen Eindruck in Audio-Video-Gesprächen gab, während echte Menschen bei 3,92 und das bisher beste KI-Modell bei 2,80 lagen.

Verfügbar ist nur eine Vorschau, Griffin-Lite, für ausgewählte Tester. Eine vollwertige Version wird versprochen, sobald Sicherheitsbedenken ausgeräumt sind. Tavus wurde im Jahr 2020 gegründet und hat rund 64.000.000 US-Dollar eingesammelt.

Zum Vergleich die Zahlen von Microsoft. MAI-Transcribe-2-Streaming kostet 0,54 US-Dollar pro Stunde Audio zu einem Einführungspreis bis Ende des Jahres. MAI-Voice-2.1 spricht laut Microsoft 23 Sprachen in derselben Stimme, jeweils mit nativem Akzent. Die Flash-Variante kostet 15 US-Dollar pro Millionen Zeichen statt 22 US-Dollar. Beide können eine Stimme aus wenigen Sekunden Referenzaudio klonen. In einem Microsoft-Test hielten etwa die Hälfte von 4.000 Teilnehmern die Stimmen für echt.

Video-Modelle erscheinen weiter, ebenso wie die Fragen

Der Veröffentlichungskalender ist voll. Die Schlagzeilenliste der Dossiers umfasst FLUX 3 Image, das Generationen in bis zu 2.000 p unterstützt, Subjekt-Positionierung und partielle Bearbeitung, mit einer Open-Source-Version in wenigen Wochen. Dazu kommen Seedance 2.5 von ByteDance und Kling 4.0 vom KI-Ausgriff von Kuaishou. Keiner dieser Releases ist in den hier vorliegenden Quelltexten im Detail beschrieben, daher sind die Angaben dünn. Dokumentiert ist das benachbarte Tooling.

Ideogram sagte am 1. Oktober, Ideogram 4.5 werde nur den Teil eines Bildes verändern, den ein Benutzer auswählt. Das geschieht in vier Qualitätsstufen von 0,8 bis 22 Cent pro Bild und nativer 2K-Auflösung, mit einem versprochenen Open-Weight-Release. Das ist eine Korrektur eines bekannten Fehlers, keine neue Fähigkeit: Wiederholte Bearbeitungen an Modellen wie GPT-Image 2.5 und Nano Banana hinterlassen laut The Decoder weiterhin Artefakte.

Dann ist da das Geld. Dealroom berichtete am 30. September, dass Luma 9.000 GPUs in sechs Stunden für den Launch von Dream Machine skalierte. Runway stieg mit einem Open-Weight-Modell namens Praxis-1 in die Robotik ein, wie Robotics & Automation News am 1. Oktober meldete. Beide fallen in den zehn Kernquellen unten nicht auf, weil das Dossier nur ihre Schlagzeilen trägt.

„Speichersysteme glätten Preise, aber sie erzeugen keinen Strom“, sagte Leonhard Gandhi, Projektleiter für Energy Charts beim Fraunhofer ISE, als sein Institut einen Simulator für deutsche Tag-ahead-Strompreise veröffentlichte.

Er sprach über Batterien, nicht über GPUs. Die Analogie ist nicht perfekt, aber die Einschränkung hat die gleiche Form: Inferenzkapazität ist ein physischer Input, und das Dossier zeigt, was passiert, wenn sie knapp wird. Das dänische Parlament verabschiedete am 2. Oktober einen Notfall-Netzplan, der die Reihenfolge der Anschlussanträge durch vier Prioritätskategorien ersetzt. Rechenzentren landen in der am wenigsten priorisierten Ebene, es sei denn, sie sind an eine kritische gesellschaftliche Funktion gebunden.

Mittlerweile fragmentiert sich die Modell-Ebene weiter. Amazon Web Services veröffentlichte Strands Decider 2B, ein Open-Source-Entscheidungsmodell, in derselben Woche, in der OpenAI ein ähnliches Angebot ankündigte, wie TechCrunch am 1. Oktober berichtete. Cloudflare antwortete mit Clef und Clef-flash, Open-Weight-Entscheidungsmodellen, die laut dem Unternehmen drei von vier Benchmarks von TypeSafes Jev schlagen. Der Preis liegt bei 0,24 US-Dollar pro Millionen Tokens gegenüber 0,042 US-Dollar bei Jev. Cloudflare meldete diese Scores selbst, und sie wurden auf dem offiziellen Index nicht reproduziert, wie The Register feststellte.

Keines davon beantwortet die Frage, die ein Zuschauer in den ersten zwei Sekunden eines synthetischen Clips stellt: Ist das ein Mensch? Tavus hat eine Zahl dafür. Sie liegt bei 48 Prozent, in einer einminütigen Call-Studie, die das Unternehmen selbst durchführte.

Kommentare 0

Quellen

15
  1. 01Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  2. 02Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute callEN
  3. 03Ideogram says its new model can edit part of an image without messing up the restEN
  4. 04Amazon releases its own Jev clone as decision models flood the webEN
  5. 05Cloudflare tries to outplay Jev with open-weight Clef modelsEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Fraunhofer ISE releases electricity price simulatorEN
  8. 08Denmark approves new grid connection prioritization modelEN
  9. 09Google releases Gemini 4 Argon, called its most powerful model yetEN
  10. 10Google rolls out new Gemini AI model but restricts access over safety concernsEN
  11. 11OpenAI scraps release of new model over safety concerns in internal testingEN
  12. 12OpenAI says planned GPT-6.1 is too insecure to releaseEN
  13. 13OpenAI abandons plan to release upcoming model as safety concerns escalateEN
  14. 14The NHL Is Releasing Its Own 'Hot' Fanfic. Romance Lovers Hate ItEN
  15. 15The Tesla Model 3 Gets A Range Bump And A New Screen In The U.S.EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.