Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

NHL sięga po romansowe audiobooki, gdy twórcy AI wideo walczą o uwagę

Narodowa Liga Hokejowa rozpoczęła w tym tygodniu emisję krótkich nagrań w stylu powieści romantycznych. Kampania spotkała się z ostrą krytyką części topowych autorów gatunku, podczas gdy generatory wideo oparte na AI wciąż się rozrastają.

AI i modeleNewsMarta ZielińskaOpublikowano: 2 października 20266 min czytaniaŹródła 12
NHL sięga po romansowe audiobooki, gdy twórcy AI wideo walczą o uwagę

Narodowa Liga Hokejowa zaczęła w tym tygodniu publikować krótkie, romansowe historie audio o swoich zawodnikach. Niektórzy pisarze, których klub poprosił o współpracę, publicznie odmówili udziału. Portal WIRED poinformował w piątek o pierwszej partii materiałów, będącej częścią kampanii „Hot for Hockey”. Zespół ligowy kontaktował się z popularnymi autorkami romansów hokejowych, by te napisały i nagłośniły fragmenty trwające od 60 do 90 sekund dla platform audiobookowych.

Opowieści nie są typowymi romansami. Czytają się jak notki na okładkach, mające sprzedać bilety.

WIRED przytoczył pełny tekst jednego z utworów, zatytułowanego „Lato, w którym stałem się twardzielem z Trevorem Zegrasem”: „Trevor Zegras przyjechał do Filadelfii szukając nowego początku. Ale po walce z Pittsburghiem w playoffach rok temu, odkrył, jak twarda może być gra. Po jednym gorącym lecie, przystojniak z Philly wygląda o wiele twardziej”. Pierwsza partia obejmuje również Sebastiana Aho z Carolina Hurricanes oraz Jacka Eichela z Vegas Golden Knights, według WIRED. Autorką jest C.R. Jane, pisarka znana z serii Pucking Wrong.

Nie wszyscy w gatunku są zadowoleni. Emily Rath, bestsellerowa autorka romansów hokejowych, napisała na Threads, że liga z nią kontaktowała i że „nigdy tak szybko nie odrzuciła oferty”, jak relacjonował WIRED. Rath stwierdziła, że prezentacja kampanii zawierała żarty, które uważa za parodię gatunku, oraz rzekome renderingsi okładek wygenerowane przez AI. Chelsea Curto, autorka serii D.C. Stars, również zwróciła uwagę na grafikę z AI, pisząc, że dobrze, iż odmówiła, bo jej książki „mogą być bardzo krytyczne wobec ligi”.

Rzecznik NHL, Jon Weinstein, powiedział WIRED, że kampania to „zabawny ukłon w stronę czegoś, co wyraźnie dzieje się w kulturowym zewzrocie”. Dodał, że liga jest „bardzo dumna ze współpracy z prawdziwymi autorami, ilustratorami i lektorami z branży”.

Strona wizualna nie zwalnia

Historia NHL to użyteczne przypomnienie, że treści generowane lub wspomagane AI są teraz rutynową częścią marketingu dużych organizacji, a odbiorcy to zauważają. Po stronie modeli ostatni tydzień przyniósł solidny strumień premier skierowanych na pracę z wideo i obrazami.

Ideogram ogłosiło 1 października, że nowy model Ideogram 4.5 potrafi edytować część obrazu, nie zmieniając reszty. To problem, na który, jak twierdzi firma, nadal cierpią wiodące modele, takie jak GPT-Image 2.5 i Nano Banana, pozostawiające artefakty po wielokrotnych edycjach. The Decoder donosi, że model jest dostępny w czterech poziomach jakości, kosztujących od 0,8 do 22 centów za obraz w natywnej rozdzielczości 2K. Dostępny jest teraz na platformie i API Ideogramu, a partnerami są m.in. Picsart, Runway, Pika i Leonardo AI. Zapowiedziano rychłe wydanie otwartych wag.

Tymczasem Tavus wprowadziło Griffin, które nazywa pierwszym „Modelem Interakcji Ludzkiej”. System przetwarza mowę, wyrazy twarzy, ton, gesty i pauzy, jednocześnie odbierając i generując wideo. Według The Decoder, 48 procent uczestników badania Tavus uważało Griffin za prawdziwą osobę po jednowymiarowej rozmowie wideo, podczas gdy poprzedni rekord wynosił dwa procent. W teście opisanym przez Tavus jako niezależna ocena Nvidii, mierząca, jak ludzkie jest AI w bezpośredniej rozmowie audio-wideo, Griffin uzyskało 3,83 punktu, wobec 3,92 dla rzeczywistych ludzi i 2,80 dla poprzedniego najlepszego modelu AI.

Podgląd o nazwie Griffin-Lite jest otwarty dla „wybranych testerów jako podgląd badawczy”, a pełniejsza wersja ma nadejść, gdy „zagrożenia bezpieczeństwa zostaną zaadresowane”, donosi The Decoder. Tavus wymienia jako możliwe zastosowania korepetycje, ćwiczenie trudnych rozmów oraz wsparcie techniczne oparte na kamerze.

Modele głosowe i decyzyjne trafiają w to samo okno

Microsoft AI wypuściło nowe modele mowy 2 października. Według The Decoder, MAI-Transcribe-2-Streaming transkrybuje 60 języków i zwraca pierwsze częściowe wyniki w nieco ponad 100 milisekundach. Microsoft twierdzi, że pozwala to agentom głosowym odpowiadać, gdy osoba jest jeszcze w połowie zdania. Godzina audio kosztuje 0,54 dolara po cenie promocyjnej do końca roku. Dwa nowe modele text-to-speech, MAI-Voice-2.1 i MAI-Voice-2.1-Flash, obsługują 23 języki w tym samym głosie, przy czym wariant Flash ma opóźnienie 150 milisekund i kosztuje 15 dolarów za milion znaków zamiast 22. Oba mogą sklonować głos z kilku sekund nagrań referencyjnych. W jednym z testów przytoczonym przez The Decoder około połowa z 4 000 uczestników pomyślała, że głosy należą do prawdziwej osoby.

Modele decyzyjne mają swój własny moment. Amazon Web Services wydało Strands Decider 2B, model open source, który sortuje między wcześniej ustalonymi opcjami i zwraca miarę pewności, donosi TechCrunch z 1 października. Zbudował go wyróżniony inżynier Marc Brooker, po tym jak zobaczył Jev od TypeSafe, i krótko znajdował się na szczycie rankingu Jevbench dla modeli tej wielkości. „Co pierwotnie wzbudziło moją ciekawość w tej klasie modeli, to że są idealnym decyderem dla kroku w workflow”, powiedział Brooker TechCrunch.

Własne Jev od TypeSafe, wydane 1 października według InfoQ, zwraca typowane decyzje probabilistyczne zamiast tekstu. Kosztuje 0,042 dolara za milion tokenów wejściowych, przy darmowym wyjściu, ma okno kontekstu 32 000 tokenów i cytowane opóźnienie end-to-end od 70 do 500 milisekund. Inżynier Vercel, Pranit Sharma, odkrył, że klasyfikator bezpieczeństwa działał od pięciu do 18 razy szybciej niż zastępowany przez niego LLM. Analiza 12 759 tweetów o premierze przez OpenChamber oszacowała zgłaszane przez użytkowników przyspieszenie na medianę 7x, wobec nagłówkowego 193,6x, oszczędności kosztów na medianę 30x, a opóźnienie na medianę 76 ms.

Cloudflare odpowiedziało 1 października modelem Clef i Clef-flash, otwartymi modelami decyzyjnymi, które mogą również obsługiwać obrazy i wideo i wspierają okno kontekstu 64 000, donosi The Register. Cloudflare twierdzi, że Clef kosztuje 0,24 dolara za milion tokenów, niemal sześć razy więcej niż cena Jev. Firma samodzielnie zgłosiła swoje wyniki benchmarków, które nie zostały jeszcze odtworzone na oficjalnym Decision Index, zauważył The Register.

Google Gemini 4 Argon, ogłoszone 30 września, jest ograniczane do zweryfikowanej grupy partnerów ds. cyberbezpieczeństwa w ramach programu Fairwind firmy. „Bezpieczne wydawanie możliwości frontier na tym poziomie wymaga podejścia etapowego”, napisał Koray Kavukcuoglu, główny architekt AI w Google, w poście na blogu przytoczonym przez The Guardian. TechCrunch donosi, że Google twierdzi, iż Argon pokonało OpenAI GPT-6 Astra oraz modele Fable i Opus od Anthropic na kilku benchmarkach, powołując się na startup Vals.

W kwestii praw autorskich Anthropic wezwała australijski rząd do rozważenia „warunkowej akceptacji” treningu na australijskich dziełach chronionych prawem autorskim na modelu opt-out, według zgłoszenia doniesionego przez The Guardian. ABC i SBS zaprotestowały, przy czym ABC ostrzegła przed „kanibalizacją australijskiego przemysłu informacyjnego” i zaapelowała, by firmy AI podlegały tym samym przepisom o prawach autorskich, diffamacji i prywatności co media.

OpenAI poinformowało, że zakłóciło kampanię „adwersarialnej destylacji”, która rozpoczęła się na początku lipca i osiągnęła szczyt z 16 000 zapytań od ponad 4 000 użytkowników w ciągu dwóch dni. Przypisała kluczowy klaster osobom związanym z chińską Moonshot AI, donosi CNBC. The Register zauważył, że OpenAI nie podało, które z jego modeli były celem, a Moonshot nie odpowiedział na prośbę o komentarz.

Komentarze 0

Źródła

12
  1. 01The NHL Is Releasing Its Own 'Hot' Fanfic. Romance Lovers Hate ItEN
  2. 02Ideogram says its new model can edit part of an image without messing up the restEN
  3. 03Nearly half of test subjects mistook Tavus' AI video avatar for a real person on a one-minute callEN
  4. 04Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  5. 05Amazon releases its own Jev clone as decision models flood the webEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Cloudflare tries to outplay Jev with open-weight Clef modelsEN
  8. 08Google rolls out new Gemini AI model but restricts access over safety concernsEN
  9. 09Google releases Gemini 4 Argon, called its most powerful model yetEN
  10. 10Anthropic pushes for opt-out model for Australian content as ABC warns of 'cannibalisation' of newsEN
  11. 11AI race heats up as OpenAI flags alleged model-copying campaignEN
  12. 12Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.