OpenAI hat eine koordinierte Kampagne offengelegt, die geschütztes Modell-Reasoning in großem Maßstab extrahieren sollte. Nach Angaben des Unternehmens begann die beobachtete Aktivität am 1. Juli. Am 24. und 25. Juli registrierte OpenAI 16.000 Requests mit einem relevanten Extraktionsmuster aus mehr als 4.000 Nutzerkonten. Die anschließende Untersuchung verband ähnliche Prompt-Muster mit einem Cluster von mehr als 15.000 Accounts.
OpenAI schreibt einen Kern dieses Clusters Personen zu, die mit Moonshot AI verbunden seien, dem Entwickler von Kimi. Das Unternehmen schränkt die Attribution ausdrücklich ein: Es sei unklar, ob sämtliche beobachteten Operatoren zu einem einzigen Akteur gehörten. Moonshot ist damit nicht als Betreiber jedes einzelnen Accounts belegt.
Der Angriff zielte auf geschütztes Reasoning, nicht auf eine Datenbank
Nach OpenAIs Darstellung wurden weder Verschlüsselung gebrochen noch eine Datenbank kompromittiert oder gespeicherte Nutzerkonversationen direkt ausgelesen. Die Kampagne setzte stattdessen an der Modellinteraktion selbst an.
OpenAI beobachtete unter anderem Versuche, verschlüsseltes Reasoning aus einer Konversation in eine andere zu übertragen und das Modell dort dazu zu bringen, den verborgenen Inhalt wiederzugeben. Das ist für Model Security eine andere Angriffsklasse als klassischer Credential- oder Datenbankdiebstahl: Das zu schützende Asset entsteht während der Inferenz und muss auch über Konversations-, Workspace- und Modellgrenzen hinweg geschützt bleiben.
Unabhängige Sicherheitsforscher hatten OpenAI nach Angaben des Unternehmens verwandte Cross-Model- und Conversation-Compaction-Schwachstellen gemeldet. OpenAI sagt, diese Angriffspfade geprüft und bestätigt zu haben.
OpenAI schloss einen Replay-Pfad für verschlüsseltes Reasoning
Die Gegenmaßnahmen zeigen, wo die technische Grenze zuvor zu durchlässig war. OpenAI schloss einen Pfad, über den jemand bereits erlangtes verschlüsseltes Reasoning eines anderen Nutzers erneut einspielen und dessen Inhalt wiederherstellen konnte.
Zusätzlich wurden Prüfungen ergänzt, die gestreamte Ausgaben zurückhalten sollen, wenn sie geschütztes Reasoning offenlegen könnten. OpenAI sperrte beziehungsweise beschränkte außerdem Accounts, verschärfte Signup- und Infrastrukturkontrollen und erweiterte das Monitoring für zusammengehörige Account-Netzwerke.
Das Unternehmen gibt an, den beobachteten Cluster bis zum 28. Juli vollständig gestört zu haben. Die genannten 16.000 Requests sind laut OpenAI Extraktionsversuche; die Zahl sagt nicht, wie viele davon tatsächlich erfolgreich waren.
Distillation wird zu einem Account- und Inference-Security-Problem
Distillation ist als Trainingsverfahren nicht neu. Der hier dokumentierte Fall betrifft laut OpenAI jedoch die systematische, nicht autorisierte Extraktion von Reasoning, um Fähigkeiten eines anderen Modells nachzubilden oder zu verbessern.
Für Anbieter entsteht dadurch ein ungewöhnliches Erkennungsproblem. Ein einzelner Request kann wie eine normale Modellinteraktion aussehen. Das Signal liegt teilweise erst in der Wiederholung ähnlicher Prompt-Muster über viele Accounts und Infrastrukturen hinweg.
Genau diese Größenordnung ist im aktuellen Bericht konkret: mehr als 15.000 Accounts im erweiterten Cluster, ein kurzfristiger Spike von 16.000 Requests und koordinierte Aktivität über mehrere Wochen.
Anthropic hatte im September separat deutlich größere Distillation-Kampagnen gegen Claude beschrieben und dabei unter anderem Alibaba und Moonshot genannt. Die beiden Berichte stammen von konkurrierenden US-Labs und ihre Attributionen sind Herstellerangaben. Sie dokumentieren aber unabhängig voneinander, dass der Schutz von Frontier-Modellen inzwischen nicht am API-Key endet.
OpenAI nennt drei verbleibende Arbeitsbereiche: stärkere technische Extraktionskontrollen, Erkennung koordinierter Kampagnen und Threat-Information-Sharing mit anderen Modellanbietern und Behörden. Besonders relevant ist der erste Punkt. Wenn geschütztes Reasoning zwischen Sessions oder Modellfamilien portierbar ist, muss seine Vertraulichkeit über den gesamten Lebenszyklus dieses Artefakts erhalten bleiben.