Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Microsoft wypuszcza modele do streamingu mowy, podczas gdy entuzjazm wokół AI wideo spotyka się ze sceptycyzmem

Microsoft AI wydał 2 października MAI-Transcribe-2-Streaming oraz dwa modele do syntezy mowy z tekstu. Firma twierdzi, że jej model transkrypcji zajmuje pierwsze miejsce w dokładności na platformie Artificial Analysis, a wariant MAI-Voice-2.1-Flash osiąga opóźnienie 150 ms.

AI i modeleNewsMarta ZielińskaOpublikowano: 2 października 20264 min czytaniaŹródła 15
Microsoft wypuszcza modele do streamingu mowy, podczas gdy entuzjazm wokół AI wideo spotyka się ze sceptycyzmem

Microsoft AI wydał 2 października MAI-Transcribe-2-Streaming oraz dwa modele do syntezy mowy z tekstu, jak poinformował The Decoder, który opisał premierę. Według Microsoftu model transkrypcji obsługuje 60 języków i zwraca częściowe wyniki w niecałe 100 milisekund.

To nie jest generator wideo. To jednak warstwa, która decyduje, czy syntetyczny prezenter sprawia wrażenie rozmówcy, czy nagrania. Premiera zbiega się w czasie z tygodniem, w którym branża wideo dostała lekcję dotyczącą trudności ostatnich metrów wdrożenia.

Prestiżowa twierdzenie o realizmie

Tavus wprowadziło 1 października Griffin, nazywając go pierwszym „Modelem Interakcji z Człowiekiem”. The Decoder opisał własne badania firmy: 48 procent uczestników uważało Griffin za prawdziwą osobę po rozmowie wideo trwającej minutę, co stanowi wzrost wobec poprzedniego rekordu wynoszącego 2 procent. Tavus informuje, że test Nvidii ocenił Griffin na 3,83 punktu za ludzkość w rozmowie audio-wideo, podczas gdy prawdziwi ludzie uzyskali 3,92, a poprzednio najlepszy model AI 2,80.

Dostępna jest tylko wersja podglądowa, Griffin-Lite, dla wybranych testerów. Pełna wersja ma pojawić się po rozwiązaniu kwestii bezpieczeństwa. Tavus zostało założone w 2 020 roku i pozyskało około 64 000 000 dolarów.

Porównajmy to z wynikami głosowymi Microsoftu. MAI-Transcribe-2-Streaming kosztuje 0,54 dolara za godzinę audio przy cenie promocyjnej obowiązującej do końca roku. MAI-Voice-2.1 mówi w 23 językach tym samym głosem, ale z rodzimym akcentem w każdym, według Microsoftu. Wariant Flash kosztuje 15 dolarów za milion znaków zamiast 22 dolarów. Oba modele mogą sklonować głos z kilku sekund referencyjnego nagrania. W jednym teście Microsoftu około połowa z 4 000 uczestników sądziła, że głosy należą do prawdziwej osoby.

Modele wideo wciąż się pojawiają, a pytania też

Kalendarz premier jest gęsty. Lista z dossier zawiera FLUX 3 Image, który obsługuje generowanie do 2 000 pikseli, pozycjonowanie obiektów i częściowe edytowanie, z wersją open-source oczekiwaną w ciągu kilku tygodni. Są tam też Seedance 2.5 od ByteDance oraz Kling 4.0 od spin-offu AI Kuaishou. Żadna z tych premier nie jest szczegółowo opisana w dostarczonych źródłach, więc konkretów jest mało. Udokumentowane są za to sąsiednie narzędzia.

Ideogram poinformowało 1 października, że Ideogram 4.5 będzie zmieniało tylko wybraną przez użytkownika część obrazu. Oferuje cztery poziomy jakości od 0,8 do 22 centów za obraz oraz natywną rozdzielczość 2K, z zapowiedzią wydania open-weight. To korekta znanego błędu, a nie nowa funkcja: powtarzane edycje w modelach takich jak GPT-Image 2.5 i Nano Banana nadal zostawiają artefakty, według The Decoder.

Są też pieniądze. Dealroom poinformował 30 września, że Luma skalowało 9 000 GPU w sześć godzin na potrzeby premiery Dream Machine. Runway wszedł w robotykę z modelem open-weight o nazwie Praxis-1, według Robotics & Automation News z 1 października. Obie firmy nie są w dziesięciu źródłach podstawowych poniżej, ponieważ dossier zawiera tylko ich nagłówki.

„Systemy magazynowania wygładzają ceny, ale nie produkują prądu”, powiedział Leonhard Gandhi, kierownik projektu Energy Charts w Fraunhofer ISE, gdy jego instytut opublikował symulator cen energii elektrycznej na dzień następny w Niemczech.

Mówił o bateriach, nie o GPU. Analogia nie jest idealna, ale ograniczenie ma ten sam kształt: moc obliczeniowa do inferencji to wejście fizyczne. Dossier pokazuje, co się dzieje, gdy staje się rzadkie. Parlament Danii przyjął 2 października awaryjny plan sieci, który zastępuje kolejność zgłoszeń czterema kategoriami priorytetów. Centra danych znajdują się w najmniej priorytetowej kategorii, chyba że są związane z kluczową funkcją społeczną.

Warstwa modeli nadal się fragmentuje. Amazon Web Services wydało Strands Decider 2B, otwarty model decyzyjny, w tym samym tygodniu, w którym OpenAI ogłosiło podobną ofertę, jak poinformował TechCrunch 1 października. Cloudflare odpowiedziało Clef i Clef-flash, otwartymi modelami decyzyjnymi, które według firmy pokonują Jev od TypeSafe w trzech z czterech własnych benchmarków TypeSafe. Kosztują 0,24 dolara za milion tokenów w porównaniu z 0,042 dolara za Jev. Cloudflare samo podało te wyniki i nie zostały one odtworzone na oficjalnym indeksie, jak zauważył The Register.

Nic z tego nie rozstrzyga pytania, które widz zadaje w pierwszych dwóch sekundach syntetycznego klipu: czy to osoba. Tavus ma jedną liczbę. To 48 procent, w rozmowie minutowej, w badaniu przeprowadzonym przez samą firmę.

Komentarze 0

Źródła

15
  1. 01Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  2. 02Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute callEN
  3. 03Ideogram says its new model can edit part of an image without messing up the restEN
  4. 04Amazon releases its own Jev clone as decision models flood the webEN
  5. 05Cloudflare tries to outplay Jev with open-weight Clef modelsEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Fraunhofer ISE releases electricity price simulatorEN
  8. 08Denmark approves new grid connection prioritization modelEN
  9. 09Google releases Gemini 4 Argon, called its most powerful model yetEN
  10. 10Google rolls out new Gemini AI model but restricts access over safety concernsEN
  11. 11OpenAI scraps release of new model over safety concerns in internal testingEN
  12. 12OpenAI says planned GPT-6.1 is too insecure to releaseEN
  13. 13OpenAI abandons plan to release upcoming model as safety concerns escalateEN
  14. 14The NHL Is Releasing Its Own 'Hot' Fanfic. Romance Lovers Hate ItEN
  15. 15The Tesla Model 3 Gets A Range Bump And A New Screen In The U.S.EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.