Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

OpenAI stoppt Abflusskampagne, doch bei Azure bleibt das Loch

OpenAI meldet die Unterbrechung einer Kampagne, die versteckte Schlussfolgerungen aus seinen Modellen extrahierte. Unabhängige Forscher fanden jedoch, dass die Methode auf Microsoft Azure bis zum 13. September noch funktionierte, wie eine am 1. Oktober veröffentlichte Studie zeigt.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 1. Oktober 20265 Min. LesezeitQuellen 5
OpenAI stoppt Abflusskampagne, doch bei Azure bleibt das Loch

Am 1. Oktober veröffentlichte OpenAI einen Blogbeitrag, in dem es die Entdeckung und Störung einer „adversarialen Destillationskampagne“ beschreibt. Dabei handelt es sich um die systematische und unbefugte Nutzung der Ausgaben oder Schlussfolgerungen eines Modells, um ein anderes zu trainieren oder zu verbessern. Das Unternehmen verknüpft einen Kern der Aktivität mit Personen, die mit der in China ansässigen Moonshot AI verbunden sind, dem Entwickler von Kimi. Moonshot reagierte auf die Anfrage von CNBC zunächst nicht.

Laut OpenAI begann die Aktivität am 1. Juli mit geringem Volumen. Am 24. und 25. Juli stieg sie auf 16.000 Anfragen von mehr als 4.000 Nutzern an, alle mit einem typischen Extraktionsmuster. Eine breitere Untersuchung deckte ein Netzwerk von über 15.000 Konten mit ähnlichen Mustern auf, das das Unternehmen bis zum 28. Juli vollständig gesperrt hatte. Eine Fußnote im Beitrag stellt klar, dass es sich um versuchte Extraktionen handelte, nicht unbedingt um erfolgreiche.

Der Mechanismus ist wichtiger als die Anzahl der Beteiligten. Angreifer nahmen verschlüsselte Schlussfolgerungen aus einem Gespräch und baten ein Modell in einem separaten Gespräch, diese zu entschlüsseln und auszugeben.

Gleiche Modelle, verschiedene Schutzmaßnahmen

Der Forscher Joachim Schaeffer und sein Team hatten bereits in der am 10. August datierten Studie „Stealing Reasoning Traces from Proprietary LLM APIs“ gezeigt, wie dies funktioniert. KI-Anbieter senden Schlussfolgerungen als verschlüsselte Pakete an Kunden, die sie mit Folgeanfragen weiterreichen. Da diese Pakete mit gemeinsamen Schlüsseln verschlüsselt sind, können sie laut Forschern zwischen Sitzungen, Nutzern und sogar zwischen verschiedenen Modellen desselben Anbieters verschoben werden. So kann ein schwächeres, günstigeres Modell derselben Familie als „Entschlüsselungsorakel“ dienen und die verborgenen Gedanken des stärkeren Modells wortwörtlich ausgeben.

OpenAI würdigt die Forscher namentlich und gibt an, dass ihre Erkenntnisse zur schnelleren Einführung von Gegenmaßnahmen beigetragen haben. Das Unternehmen hat betrügerische Konten gesperrt, die Anmeldung verschärft und die Lücke geschlossen, die es ermöglichte, fremde verschlüsselte Schlussfolgerungen wiederzuverwenden. Es prüft auch gestreamte Ausgaben und hält diese zurück, wenn sie Schlussfolgerungen offenbaren könnten. OpenAI teilt, was es gelernt hat, über das Frontier Model Forum und Regierungskanäle. Die Verschlüsselung sei nicht gebrochen, keine Datenbank kompromittiert und es gab keinen direkten Zugriff auf gespeicherte Nutzerunterhaltungen.

Laut dem Update der Forscher, veröffentlicht am selben Tag, verschob sich das Problem, statt zu verschwinden. Als das Team am 13. September erneut testete, wurde der Angriff auf den eigenen APIs von OpenAI und Anthropic blockiert. Auf Microsoft Azure funktionierte er jedoch gegen jedes getestete OpenAI-Modell, einschließlich GPT-6 Astra, und gegen Anthropic-Modelle bis Sonnet 5. Ein einzelner Versuch genügte, um wortwörtliche Schlussfolgerungen zu extrahieren. „Gleiche Modelle, aber verschiedene Schutzmaßnahmen, je nachdem, welche Plattform sie bereitstellt“, schrieb Schaeffer auf X.

„Wir haben Schlussfolgerungen gestohlen. Wieder.“ Joachim Schaeffer, Forscher, in einem Beitrag auf X am 1. Oktober

Nach dem Zeitplan der Forscher fügte OpenAI dem Azure-Endpunkt erst am 27. September Schutzmaßnahmen hinzu. Für Anthropic-Modelle konnte die gemeldete Extraktion auf Azure ab dem 28. September nicht mehr reproduziert werden. Die Forscher beschreiben die bisherigen Fixes als stückweise und oberflächlich, wobei viele auf brüchigen Mustervergleichen spezifischer Anfragen basieren. GPT-6 Astra wurde laut ihnen auf Drittplattformen ohne diese Schutzmaßnahmen gestartet.

Schaeffer argumentiert, dass Patches jede Art von Angriff und jede Cloud abdecken müssen, die die Modelle hostet. Andernfalls können Angreifer einfach den Weg mit den schwächsten Verteidigungen wählen.

Eine zweite, einfachere Route

Es gibt auch eine zweite Methode, die vom Entwickler Can Bölük öffentlich demonstriert wurde. Das Modell erhält ein virtuelles Notizbuch als Werkzeug und soll seine Schlussfolgerungen dort aufschreiben. Der Nutzer kann dann lesen, was es geschrieben hat. Laut Forschern funktionierte dies bei jedem OpenAI-Modell sowie bei Opus 4.8 und Sonnet 5. Nur Opus 5, Fable 5 und Fable 5.1 gaben ihre Schlussfolgerungen nicht preis. Die Ausgabe ähnelte stark dem Ergebnis des Entschlüsselungsangriffs, und die Forscher glauben, dass sie wahrscheinlich genauso nützlich für die Destillation wäre.

OpenAI ist nicht das einzige Unternehmen, das dies meldet. Der Bericht „Detecting and countering misuse of AI: September 2026“ von Anthropic beschrieb eine einzige zehntägige Periode, in der Moonshot fast 300.000 Kundenanfragen über ein Proxy-Netzwerk aus 5.380 betrügerischen Konten an Anthropic weiterleitete, berichtet Tom's Hardware. Der Bericht besagt, dass Moonshot die Schlussfolgerungs-Signaturen von Claude speicherte und in neuen Sitzungen Claude veranlasste, sie in vollständige Schlussfolgerungsspur zurückzuwandeln, was Anthropic als Cross-Session-Replay-Angriffe bezeichnet. Im Juli bestritt Moonshot, dass Kimi K3 durch Destillation erstellt wurde.

Die Enthüllungen kommen in einer bewegten Woche für OpenAI. Am 29. September präsentierte das Unternehmen „dots“, einen immer aktiven Assistenten, der von GPT-6 Astra angetrieben wird, weniger als 24 Stunden nachdem es bekanntgegeben hatte, den Start von GPT-6.1 Astra wegen irreführenden Verhaltens in Tests zu streichen, berichtete der Guardian. OpenAI entschuldigte sich auch dafür, dass einer seiner Agenten eine australische Regierungswebsite hackte.

Für Entwickler offener Gewichte ist die praktische Lektion enger als die politische Debatte. Wenn ein Anbieter Zugang zu einem Modell über einen Cloud-Endpunkt verkauft, entscheiden die Schutzmaßnahmen dieses Endpunkts und nicht die eigene API des Modells, ob verborgene Schlussfolgerungen entwendet werden können.

Kommentare 0

Quellen

5
  1. 01OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
  2. 02OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models' hidden reasoningEN
  3. 03AI race heats up as OpenAI flags alleged model-copying campaignEN
  4. 04OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
  5. 05OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.