Microsoft wypuszcza modele do streamingu mowy, podczas gdy entuzjazm wokół AI wideo spotyka się ze sceptycyzmem
Microsoft AI wydał 2 października MAI-Transcribe-2-Streaming oraz dwa modele do syntezy mowy z tekstu. Firma twierdzi, że jej model transkrypcji zajmuje pierwsze miejsce w dokładności na platformie Artificial Analysis, a wariant MAI-Voice-2.1-Flash osiąga opóźnienie 150 ms.

Microsoft AI wydał 2 października MAI-Transcribe-2-Streaming oraz dwa modele do syntezy mowy z tekstu, jak poinformował The Decoder, który opisał premierę. Według Microsoftu model transkrypcji obsługuje 60 języków i zwraca częściowe wyniki w niecałe 100 milisekund.
To nie jest generator wideo. To jednak warstwa, która decyduje, czy syntetyczny prezenter sprawia wrażenie rozmówcy, czy nagrania. Premiera zbiega się w czasie z tygodniem, w którym branża wideo dostała lekcję dotyczącą trudności ostatnich metrów wdrożenia.
Prestiżowa twierdzenie o realizmie
Tavus wprowadziło 1 października Griffin, nazywając go pierwszym „Modelem Interakcji z Człowiekiem”. The Decoder opisał własne badania firmy: 48 procent uczestników uważało Griffin za prawdziwą osobę po rozmowie wideo trwającej minutę, co stanowi wzrost wobec poprzedniego rekordu wynoszącego 2 procent. Tavus informuje, że test Nvidii ocenił Griffin na 3,83 punktu za ludzkość w rozmowie audio-wideo, podczas gdy prawdziwi ludzie uzyskali 3,92, a poprzednio najlepszy model AI 2,80.
Dostępna jest tylko wersja podglądowa, Griffin-Lite, dla wybranych testerów. Pełna wersja ma pojawić się po rozwiązaniu kwestii bezpieczeństwa. Tavus zostało założone w 2 020 roku i pozyskało około 64 000 000 dolarów.
Porównajmy to z wynikami głosowymi Microsoftu. MAI-Transcribe-2-Streaming kosztuje 0,54 dolara za godzinę audio przy cenie promocyjnej obowiązującej do końca roku. MAI-Voice-2.1 mówi w 23 językach tym samym głosem, ale z rodzimym akcentem w każdym, według Microsoftu. Wariant Flash kosztuje 15 dolarów za milion znaków zamiast 22 dolarów. Oba modele mogą sklonować głos z kilku sekund referencyjnego nagrania. W jednym teście Microsoftu około połowa z 4 000 uczestników sądziła, że głosy należą do prawdziwej osoby.
Modele wideo wciąż się pojawiają, a pytania też
Kalendarz premier jest gęsty. Lista z dossier zawiera FLUX 3 Image, który obsługuje generowanie do 2 000 pikseli, pozycjonowanie obiektów i częściowe edytowanie, z wersją open-source oczekiwaną w ciągu kilku tygodni. Są tam też Seedance 2.5 od ByteDance oraz Kling 4.0 od spin-offu AI Kuaishou. Żadna z tych premier nie jest szczegółowo opisana w dostarczonych źródłach, więc konkretów jest mało. Udokumentowane są za to sąsiednie narzędzia.
Ideogram poinformowało 1 października, że Ideogram 4.5 będzie zmieniało tylko wybraną przez użytkownika część obrazu. Oferuje cztery poziomy jakości od 0,8 do 22 centów za obraz oraz natywną rozdzielczość 2K, z zapowiedzią wydania open-weight. To korekta znanego błędu, a nie nowa funkcja: powtarzane edycje w modelach takich jak GPT-Image 2.5 i Nano Banana nadal zostawiają artefakty, według The Decoder.
Są też pieniądze. Dealroom poinformował 30 września, że Luma skalowało 9 000 GPU w sześć godzin na potrzeby premiery Dream Machine. Runway wszedł w robotykę z modelem open-weight o nazwie Praxis-1, według Robotics & Automation News z 1 października. Obie firmy nie są w dziesięciu źródłach podstawowych poniżej, ponieważ dossier zawiera tylko ich nagłówki.
„Systemy magazynowania wygładzają ceny, ale nie produkują prądu”, powiedział Leonhard Gandhi, kierownik projektu Energy Charts w Fraunhofer ISE, gdy jego instytut opublikował symulator cen energii elektrycznej na dzień następny w Niemczech.
Mówił o bateriach, nie o GPU. Analogia nie jest idealna, ale ograniczenie ma ten sam kształt: moc obliczeniowa do inferencji to wejście fizyczne. Dossier pokazuje, co się dzieje, gdy staje się rzadkie. Parlament Danii przyjął 2 października awaryjny plan sieci, który zastępuje kolejność zgłoszeń czterema kategoriami priorytetów. Centra danych znajdują się w najmniej priorytetowej kategorii, chyba że są związane z kluczową funkcją społeczną.
Warstwa modeli nadal się fragmentuje. Amazon Web Services wydało Strands Decider 2B, otwarty model decyzyjny, w tym samym tygodniu, w którym OpenAI ogłosiło podobną ofertę, jak poinformował TechCrunch 1 października. Cloudflare odpowiedziało Clef i Clef-flash, otwartymi modelami decyzyjnymi, które według firmy pokonują Jev od TypeSafe w trzech z czterech własnych benchmarków TypeSafe. Kosztują 0,24 dolara za milion tokenów w porównaniu z 0,042 dolara za Jev. Cloudflare samo podało te wyniki i nie zostały one odtworzone na oficjalnym indeksie, jak zauważył The Register.
Nic z tego nie rozstrzyga pytania, które widz zadaje w pierwszych dwóch sekundach syntetycznego klipu: czy to osoba. Tavus ma jedną liczbę. To 48 procent, w rozmowie minutowej, w badaniu przeprowadzonym przez samą firmę.
Źródła
15- 01Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 02Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute callEN
- 03Ideogram says its new model can edit part of an image without messing up the restEN
- 04Amazon releases its own Jev clone as decision models flood the webEN
- 05Cloudflare tries to outplay Jev with open-weight Clef modelsEN
- 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
- 07Fraunhofer ISE releases electricity price simulatorEN
- 08Denmark approves new grid connection prioritization modelEN
- 09Google releases Gemini 4 Argon, called its most powerful model yetEN
- 10Google rolls out new Gemini AI model but restricts access over safety concernsEN
- 11OpenAI scraps release of new model over safety concerns in internal testingEN
- 12OpenAI says planned GPT-6.1 is too insecure to releaseEN
- 13OpenAI abandons plan to release upcoming model as safety concerns escalateEN
- 14The NHL Is Releasing Its Own 'Hot' Fanfic. Romance Lovers Hate ItEN
- 15The Tesla Model 3 Gets A Range Bump And A New Screen In The U.S.EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.