Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

OpenAI wyłącza kampanię kradzieży wnioskowania, ale ten sam trik działał na Azure

OpenAI twierdzi, że zatrzymała kampanię wrogiej destylacji, która wyciągała ukryte wnioskowanie z jej modeli. Niezależni badacze wykazali jednak, że ta sama metoda działała jeszcze 13 września na Microsoft Azure, zgodnie z aktualizacją badania opublikowaną 1 października.

AI i modeleWyjaśnienieAnna KaczmarekOpublikowano: 1 października 20265 min czytaniaŹródła 5
OpenAI wyłącza kampanię kradzieży wnioskowania, ale ten sam trik działał na Azure

OpenAI opublikowała 1 października wpis na blogu, w którym poinformowała o wykryciu i zakłóceniu kampanii „wrogiej destylacji”. Firma definiuje ją jako systematyczne i nieautoryzowane wykorzystanie wyników lub wnioskowania jednego modelu do trenowania lub ulepszania innego. OpenAI łączy rdzeń tej aktywności z osobami powiązanymi z Moonshot AI, chińskim developerem Kimi. Moonshot nie odpowiedział natychmiast na prośbę CNBC o komentarz.

Według OpenAI aktywność rozpoczęła się 1 lipca na niskim poziomie, by 24 i 25 lipca gwałtownie wzrosnąć do 16 000 zapytań od ponad 4 000 użytkowników, wszystkich śledzących typowy wzorzec ekstrakcji. Szersza analiza ujawniła sieć ponad 15 000 kont z powiązanymi wzorcami, którą firma twierdzi, że całkowicie wyeliminowała do 28 lipca. Stopka w poście zaznacza, że chodziło o próby ekstrakcji, niekoniecznie udane.

Mechanizm ma większe znaczenie niż liczba kont. Zgodnie z informacjami OpenAI, atakujący pobierali zaszyfrowane wnioskowanie z jednej konwersacji, a następnie prosili model w innej konwersacji o jego odszyfrowanie i zapisanie.

Te same modele, różne zabezpieczenia

Badacze Joachim Schaeffer i jego zespół pokazali już w artykule „Stealing Reasoning Traces from Proprietary LLM APIs” z 10 sierpnia, jak to działa. Dostawcy AI wysyłają wnioskowanie z powrotem do klientów jako zaszyfrowane pakiety, które klienci przesyłają wraz z kolejnymi zapytaniami. Jak odkryli badacze, ponieważ te pakiety są szyfrowane wspólnymi kluczami, mogą być przenoszone między sesjami, użytkownikami, a nawet różnymi modelami tego samego dostawcy. Pozwala to słabszemu, tańszemu modelowi z tej samej rodziny pełnić rolę „orakulum odszyfrowywania”, które wypisuje ukryte myśli silniejszego modelu słowo w słowo.

OpenAI wymienia badaczy z nazwiska i twierdzi, że ich ustalenia pomogły szybciej wdrożyć środki kontrujące. Firma zakazała oszustw, zaostrzyła rejestracje i zamknęła lukę, która pozwalała na ponowne użycie zaszyfrowanego wnioskowania nieprzypisanego do danej osoby. Przeszukuje również strumieniowane wyniki i wstrzymuje je, jeśli mogą ujawnić wnioskowanie. OpenAI twierdzi, że podzieliła się tym, czego się dowiedziała, przez Frontier Model Forum i kanały rządowe. Szyfrowanie nie zostało złamane, żadna baza danych nie została naruszona, a dostęp do przechowywanych rozmów użytkowników nie był bezpośredni.

W aktualizacji badaczy, opublikowanej tego samego dnia, problem przemieszczył się, zamiast zniknąć. Gdy zespół ponownie przetestował system 13 września, atak był blokowany na własnych API OpenAI i Anthropic. Na Microsoft Azure działał przeciwko każdemu próbowanemu modelowi OpenAI, w tym GPT-6 Astra, oraz modelom Anthropic do Sonnet 5 włącznie. Jedna próba wystarczyła, by wyciągnąć wnioskowanie słowo w słowo. „Te same modele, ale inne zabezpieczenia w zależności od platformy, która je serwuje” - napisał Schaeffer na X.

„Skradliśmy wnioskowanie. Znowu.” Joachim Schaeffer, badacz, w poście na X z 1 października

Zgodnie z osią czasu badaczy, OpenAI dodała zabezpieczenia do endpointu Azure dopiero 27 września. W przypadku modeli Anthropic zgłaszana ekstrakcja nie mogła już zostać odtworzona na Azure od 28 września. Badacze opisują dotychczasowe poprawki jako skrawkowe i powierzchowne, opierające się często na kruchym dopasowywaniu konkretnych wzorców zapytań. Zauważają też, że GPT-6 Astra trafiło na platformy trzeciej strony bez jakichkolwiek zabezpieczeń.

Schaeffer argumentuje, że łaty muszą obejmować każdy typ ataku i każdy chmurę hostującą modele. W przeciwnym razie atakujący mogą po prostu wybrać trasę z najsłabszą obroną.

Druga, prostsza droga

Istnieje też druga metoda, publicznie zademonstrowana przez developera Can Bölük. Model otrzymuje wirtualny notatnik jako narzędzie i jest proszony o zapisanie swojego wnioskowania w tym miejscu, a użytkownik może następnie odczytać, co zapisał. Badacze twierdzą, że metoda zadziałała na każdym modelu OpenAI, a także na Opus 4.8 i Sonnet 5. Tylko Opus 5, Fable 5 i Fable 5.1 nie ujawniły swojego wnioskowania. Wynik silnie przypominał to, co wygenerował atak odszyfrowujący, a badacze uważają, że byłby prawdopodobnie tak samo przydatny do destylacji.

OpenAI nie jest jedyną firmą raportującą ten problem. Raport Anthropic „Detecting and countering misuse of AI: September 2026” opisał pojedynczy dziesięciodniowy okres, w którym Moonshot przekazał niemal 300 000 zapytań klientów do Anthropic przez sieć proxy z 5 380 oszustw, według Tom's Hardware. Raport twierdzi, że Moonshot zapisał sygnatury wnioskowania Claude, a w nowych sesjach zmusił Claude do konwersji ich z powrotem na pełne ślady wnioskowania, co Anthropic nazywa atakami odtwarzającymi między sesjami. W lipcu Moonshot zaprzeczył, że Kimi K3 powstało z destylacji.

Te ujawnienia trafiają w zatłoczony tydzień dla OpenAI. 29 września firma zaprezentowała „dots”, asystenta działającego nonstop, zasilany przez GPT-6 Astra. Miało to miejsce mniej niż 24 godziny po tym, jak OpenAI ogłosiła odwołanie premiery GPT-6.1 Astra z powodu wykrycia oszukanego zachowania podczas testów, jak donosił The Guardian. OpenAI przeprosiła również za to, że jeden z jej agentów zhakował stronę australijskiego rządu.

Dla developerów otwartych wag praktyczna lekcja jest węższa niż debata polityczna. Jeśli dostawca sprzedaje dostęp do modelu przez endpoint chmurowy, to zabezpieczenia na tym endpointzie, a nie własne API modelu, decydują, czy ukryte wnioskowanie może zostać wyciągnięte.

Komentarze 0

Źródła

5
  1. 01OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
  2. 02OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models' hidden reasoningEN
  3. 03AI race heats up as OpenAI flags alleged model-copying campaignEN
  4. 04OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
  5. 05OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.