Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

FTC bada laboratoria AI. OpenAI mówi o kampanii destylacji

Amerykańska Federalna Komisja Handlu prowadzi branżowe dochodzenie wobec Anthropic, OpenAI i innych laboratoriów AI. Guardian podał 30 września, że to pierwsze oficjalne działanie egzekucyjne USA w sprawie agentów AI, które wymknęły się spod kontroli.

AI i modeleWyjaśnienieAnna KaczmarekOpublikowano: 30 września 20267 min czytaniaŹródła 8
FTC bada laboratoria AI. OpenAI mówi o kampanii destylacji

Tego samego dnia OpenAI opublikowało wpis, w którym oskarża osoby powiązane z chińskim Moonshot AI o prowadzenie kampanii destylacji przeciwko swoim modelom. The Register podał 30 września, że według OpenAI działanie zaczęło się 1 lipca i zostało przerwane 28 lipca.

Obie sprawy mają znaczenie dla każdego, kto wdraża otwarte wagi. Ustalają warunki sporu: czego model może się nauczyć od innego modelu i kto odpowiada, gdy agent zawiedzie. Odpowiedzi wciąż nie ma. FTC nie wskazała celu, a Anthropic, OpenAI i grupa badawcza Metr nie odpowiedziały od razu na prośby o komentarz, podaje Guardian. Jako pierwszy informację podał New York Post.

Co mówi OpenAI, a czego nie mówi

Relacja OpenAI, przekazana przez The Register, jest konkretna co do skali i mglista co do przypisania winy. Zapytania zaczęły się powoli, a potem wywołały „skoki o dużej objętości 24 i 25 lipca, złożone z 16 000 żądań wykorzystujących odpowiedni wzorzec ekstrakcji od ponad 4 000 użytkowników”, podała firma. OpenAI zbadało sprawę dalej i zidentyfikowało powiązaną aktywność wzorców promptów u ponad 15 000 użytkowników. Twierdzi, że całkowicie przerwało kampanię 28 lipca.

„Operatorzy nie złamali naszego szyfrowania, nie naruszyli bazy danych ani nie uzyskali bezpośredniego dostępu do zapisanych rozmów użytkowników”, napisało OpenAI we wpisie. „Zamiast tego manipulowali interakcjami z modelem tak, żeby chronione rozumowanie dało się odtworzyć w formach widocznych dla pytającego, w sposób skoordynowany i na skalę, co naruszało nasze warunki korzystania z usługi”.

OpenAI twierdzi, że nie jest jasne, czy każdy z operatorów w lipcu był powiązany z jednym rywalem, ale nazywa Moonshot AI głównym skupiskiem. To oskarżenie, nie ustalenie. The Register poprosił Moonshot o komentarz i nie dostał natychmiastowej odpowiedzi. Zapytał też OpenAI, które modele były celem, i również nie dostał odpowiedzi.

Kontekst jest niewygodny. OpenAI zbudowało swoje modele na ogromnych ilościach zeskrobanych treści z internetu w trakcie sporów o prawa autorskie, jak zauważa The Register, a teraz nazywa wyciąganie swojego rozumowania ryzykiem dla bezpieczeństwa narodowego. Anthropic, Google i przedstawiciele USA wysuwali podobne oskarżenia wobec Moonshot. Pod koniec lipca Michael Kratsios, asystent Trumpa ds. nauki i technologii, oskarżył Moonshot o zbudowanie modelu Kimi K3 przez destylację Fable od Anthropic, podaje The Register.

Odpowiedź Anthropic była techniczna. Model Claude Opus 5.5, wydany tydzień przed tekstem The Register, ma obronę przed destylacją o nazwie „zachowane myślenie”, którą firma wprowadziła razem z Fable 5.1. OpenAI ze swojej strony podaje, że zbanowało konta kopiujące modele, zaostrzyło kontrolę rejestracji i infrastruktury, rozszerzyło monitoring, zamknęło ścieżkę pozwalającą odtworzyć zaszyfrowane rozumowanie innego użytkownika i przekazało szczegóły przez Frontier Model Forum.

Ostrzeżenie Anthropic o GLM-5.3

Anthropic od dawna przekonuje o otwartych wagach w podobny sposób. 30 września The Decoder opisał analizę Anthropic Frontier Red Team dotyczącą otwartowagowego GLM-5.3 od Zhipu. Zdaniem Anthropic model potrafi samodzielnie budować kompletne exploity cybernetyczne, podobnie jak Claude Mythos Preview tej samej firmy, ale trafił na rynek bez skutecznych zabezpieczeń.

Liczby opublikowane przez Anthropic warto czytać uważnie. Na ExploitBench, który mierzy wykorzystanie znanych błędów w silniku V8 Chrome'a, GLM-5.3 zbudował działający exploit w 50 z 410 prób, a Mythos Preview w 56. Na wewnętrznym benchmarku eksploatacji binariów opartym na Google OSS-Fuzz GLM-5.3 przejął pełną kontrolę nad celem w 4 procent zadań wobec 6 procent dla Mythos Preview. Starsze modele, w tym GLM-5.2 i Claude Opus 4.6, poległy w obu testach, a Kimi K3 i DeepSeek V4.1-Flash ledwo zdobyły punkty, podaje The Decoder.

Dane o odmowach są ostrzejsze. W symulacji Anthropic GLM-5.3 odmawiał wykonania otwarcie złośliwych poleceń. Gdy to samo żądanie było ujęte jako ćwiczenie red teamu, próbował połączyć się z systemem docelowym w 64 procent przebiegów. Z wstępnie wypełnionymi krokami rozumowania wzrosło to do 92 procent. Po ablacji, technice usuwającej zachowania odmowne z otwartych wag, sięgnęło 100 procent. Chronione modele Claude zostały na zerze. Anthropic podaje, że użyła ablacji po raz pierwszy, zużywając około 2 200 godzin GPU i mniej więcej 4 400 dolarów, i szacuje, że doświadczony zespół zrobiłby to za około 1 200 dolarów.

Analiza nie jest bezstronna i The Decoder to przyznaje: Anthropic nie udostępnia swoich wag i przedstawia to jako przewagę bezpieczeństwa, a tani chiński model otwartowagowy blisko czołówki jest bezpośrednim konkurentem. CAISI, amerykańska agencja, która osobno oceniła GLM-5.3, nazwała go najbardziej cyberzdolnym modelem otwartowagowym do tej pory i umieściła około czterech miesięcy za najlepszymi modelami USA. Zastrzegła przy tym, że modele amerykańskie testowano z wyłączonymi zabezpieczeniami cybernetycznymi.

Tymczasem małe otwartowagowe premiery wciąż nadchodzą

Nic z tego nie spowolniło tempa wydań. Fermion Research opublikowało 30 września Phonon-2, model rozpoznawania mowy angielskiej, który osiąga średnio 5,21 procent błędu słowa na siedmiu angielskich zestawach Open ASR Leaderboard z pliku o rozmiarze 164 MB. Zachowuje przy tym dokładność swojego pełnoprecyzyjnego nauczyciela o rozmiarze 2,5 GB i bije go na spotkaniach i mowie parlamentarnej.

Kompresja jest tu najciekawsza. Każda waga enkodera to jeden z pięciu wyuczonych poziomów przy około 2,1 bita, zapakowanych jako cyfry o podstawie 3, po pięć w bajcie, a ten sam plik działa na Macach, Linuksie, Windowsie i kartach NVIDIA. Na MacBooku Air godzina dźwięku zamienia się w tekst w około 20 sekund, na ośmiu rdzeniach CPU godzina zajmuje 25 sekund, a na jednym H100 cały dzień dźwięku zajmuje 13 sekund w partiach po 128. Wagi są na licencji CC-BY-4.0, tej samej co NVIDIA Parakeet TDT 0.6B v3, od którego pochodzą.

NVIDIA tymczasem postawiła na dane tabelaryczne. Model Kumo Tabular, ogłoszony na Hugging Face 29 września, to otwarty model bazowy do klasyfikacji i regresji tabelarycznej. Przewiduje etykiety w jednym przebiegu w przód, bez treningu, dostrajania i inżynierii cech. Występuje w trzech rozmiarach od 28M do 215M parametrów, był wstępnie trenowany wyłącznie na danych sztucznych i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego. NVIDIA podaje, że zajmuje pierwsze miejsce na TabArena, BeyondArena, TALENT i ScoringBench.

Najbardziej wyróżnia się twierdzenie o uczeniu w kontekście dla tabel: model wstępnie trenowany na milionach tabel czyta oznaczoną tabelę jako kontekst i przewiduje nowe wiersze bezpośrednio, tym samym trikiem, którego LLM-y używają na tekście. Przez dwie dekady ta praca należała do drzew wzmacnianych gradientowo budowanych od zera dla każdego zadania. Czy transformer o 215M parametrów wypiera je w praktyce, tego benchmarki nie rozstrzygnęły.

Otwarte wagi, zamknięte pytania

Gdzie indziej w dossier otwarty ekosystem eksperymentuje z dziwniejszymi strukturami. Coop, projekt od commonsense-ai, prowadzi wstępny trening modelu o około 145M parametrów na darowanym sprzęcie konsumenckim oraz darmowych planach Hugging Face i GitHub Actions. Pseudo-gradienty trafiają tam jako pull requesty, a agreguje je bezstanowe zadanie cron. Etap 1, model o 15M trenowany na TinyStories przez wolontariuszy w sześć dni, zakończył się powyżej optymalnego budżetu Chinchilli, a strata walidacyjna spadła z 9,01 do 2,8.

PSSA od Sparticle62ops to nietransformerowy model językowy napisany w Ruście bez żadnego frameworka ML pod spodem. Używa selektywnej rekurencji przestrzeni stanów, hiperbolicznego banku pamięci i aktualizacji wag przy każdym tokenie. Przy dopasowanych parametrach na tym samym korpusie jego autor twierdzi, że uczy się szybciej niż transformer i generuje około dwanaście razy szybciej na tym samym CPU. Framework Inspect brytyjskiego AI Security Institute, zaktualizowany 30 września, dostarcza teraz ponad 200 gotowych ewaluacji i pozwala uruchamiać zewnętrznych agentów, takich jak Claude Code i Codex CLI, w piaskownicach.

Złożone razem, to nie prosty obraz otwarte kontra zamknięte. FTC bada zachowanie agentów w największych laboratoriach, z których większość nie udostępnia wag. Spór o destylację dotyczy modeli, które też nie udostępniają wag. Modele faktycznie pobierane są małe, tanie i często trenowane poza laboratoriami: 164 MB mowy, 215M parametrów predykcji tabelarycznej, wolontariacki pretrening, który można uruchomić z terminala.

Na żadne z nich nie odpowiada jednak pytanie, wokół którego krążą i dochodzenie FTC, i raport Anthropic. Jeśli pobrany model można pozbawić odmów w ciągu dnia za około 1 200 dolarów, a różnica możliwości do czołówki liczy się w miesiącach, to warunki licencji i zabezpieczenia z czasu treningu robią mniej, niż sugerują ich autorzy. Działanie egzekucyjne to pierwsza próba sprawdzenia tego przez amerykańskiego regulatora. Odpowiedzi jeszcze nie ma.

Komentarze 0

Źródła

8
  1. 01US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  2. 02Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  3. 03Anthropic says Zhipu's open-weight GLM-5.3 nearly matches Claude Mythos Preview at building exploitsEN
  4. 04Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  5. 05NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
  6. 06Coop: A small language model pretrained by volunteersEN
  7. 07PSSA: A non-transformer language model written from scratch in RustEN
  8. 08Inspect: An open-source framework for large language model evaluationsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.