Quavon Development
Model Security3 Min. Lesezeit

OpenAI stoppt Distillation-Kampagne mit mehr als 15.000 beteiligten Accounts

OpenAI hat eine koordinierte Kampagne gegen geschütztes Modell-Reasoning gestoppt. Die Untersuchung erfasste ähnliche Prompt-Muster über mehr als 15.000 Accounts; einen Kern der Aktivität schreibt OpenAI Personen mit Verbindung zu Moonshot AI zu.

Redaktion von Quavon DevelopmentVeröffentlicht Aktualisiert
Die kurze Antwort

OpenAI meldet eine koordinierte Distillation-Kampagne, bei der geschütztes Reasoning über manipulierte Modellinteraktionen extrahiert werden sollte. Am 24. und 25. Juli sah das Unternehmen 16.000 entsprechende Requests aus mehr als 4.000 Accounts; die erweiterte Untersuchung umfasste einen Cluster von mehr als 15.000 Accounts. OpenAI schreibt nur einen Kern der Aktivität Personen mit Verbindung zu Moonshot AI zu und betont, dass nicht alle Operatoren einem einzigen Akteur zugeordnet werden können.

OpenAI hat eine koordinierte Kampagne offengelegt, die geschütztes Modell-Reasoning in großem Maßstab extrahieren sollte. Nach Angaben des Unternehmens begann die beobachtete Aktivität am 1. Juli. Am 24. und 25. Juli registrierte OpenAI 16.000 Requests mit einem relevanten Extraktionsmuster aus mehr als 4.000 Nutzerkonten. Die anschließende Untersuchung verband ähnliche Prompt-Muster mit einem Cluster von mehr als 15.000 Accounts.

OpenAI schreibt einen Kern dieses Clusters Personen zu, die mit Moonshot AI verbunden seien, dem Entwickler von Kimi. Das Unternehmen schränkt die Attribution ausdrücklich ein: Es sei unklar, ob sämtliche beobachteten Operatoren zu einem einzigen Akteur gehörten. Moonshot ist damit nicht als Betreiber jedes einzelnen Accounts belegt.

Der Angriff zielte auf geschütztes Reasoning, nicht auf eine Datenbank

Nach OpenAIs Darstellung wurden weder Verschlüsselung gebrochen noch eine Datenbank kompromittiert oder gespeicherte Nutzerkonversationen direkt ausgelesen. Die Kampagne setzte stattdessen an der Modellinteraktion selbst an.

OpenAI beobachtete unter anderem Versuche, verschlüsseltes Reasoning aus einer Konversation in eine andere zu übertragen und das Modell dort dazu zu bringen, den verborgenen Inhalt wiederzugeben. Das ist für Model Security eine andere Angriffsklasse als klassischer Credential- oder Datenbankdiebstahl: Das zu schützende Asset entsteht während der Inferenz und muss auch über Konversations-, Workspace- und Modellgrenzen hinweg geschützt bleiben.

Unabhängige Sicherheitsforscher hatten OpenAI nach Angaben des Unternehmens verwandte Cross-Model- und Conversation-Compaction-Schwachstellen gemeldet. OpenAI sagt, diese Angriffspfade geprüft und bestätigt zu haben.

OpenAI schloss einen Replay-Pfad für verschlüsseltes Reasoning

Die Gegenmaßnahmen zeigen, wo die technische Grenze zuvor zu durchlässig war. OpenAI schloss einen Pfad, über den jemand bereits erlangtes verschlüsseltes Reasoning eines anderen Nutzers erneut einspielen und dessen Inhalt wiederherstellen konnte.

Zusätzlich wurden Prüfungen ergänzt, die gestreamte Ausgaben zurückhalten sollen, wenn sie geschütztes Reasoning offenlegen könnten. OpenAI sperrte beziehungsweise beschränkte außerdem Accounts, verschärfte Signup- und Infrastrukturkontrollen und erweiterte das Monitoring für zusammengehörige Account-Netzwerke.

Das Unternehmen gibt an, den beobachteten Cluster bis zum 28. Juli vollständig gestört zu haben. Die genannten 16.000 Requests sind laut OpenAI Extraktionsversuche; die Zahl sagt nicht, wie viele davon tatsächlich erfolgreich waren.

Distillation wird zu einem Account- und Inference-Security-Problem

Distillation ist als Trainingsverfahren nicht neu. Der hier dokumentierte Fall betrifft laut OpenAI jedoch die systematische, nicht autorisierte Extraktion von Reasoning, um Fähigkeiten eines anderen Modells nachzubilden oder zu verbessern.

Für Anbieter entsteht dadurch ein ungewöhnliches Erkennungsproblem. Ein einzelner Request kann wie eine normale Modellinteraktion aussehen. Das Signal liegt teilweise erst in der Wiederholung ähnlicher Prompt-Muster über viele Accounts und Infrastrukturen hinweg.

Genau diese Größenordnung ist im aktuellen Bericht konkret: mehr als 15.000 Accounts im erweiterten Cluster, ein kurzfristiger Spike von 16.000 Requests und koordinierte Aktivität über mehrere Wochen.

Anthropic hatte im September separat deutlich größere Distillation-Kampagnen gegen Claude beschrieben und dabei unter anderem Alibaba und Moonshot genannt. Die beiden Berichte stammen von konkurrierenden US-Labs und ihre Attributionen sind Herstellerangaben. Sie dokumentieren aber unabhängig voneinander, dass der Schutz von Frontier-Modellen inzwischen nicht am API-Key endet.

OpenAI nennt drei verbleibende Arbeitsbereiche: stärkere technische Extraktionskontrollen, Erkennung koordinierter Kampagnen und Threat-Information-Sharing mit anderen Modellanbietern und Behörden. Besonders relevant ist der erste Punkt. Wenn geschütztes Reasoning zwischen Sessions oder Modellfamilien portierbar ist, muss seine Vertraulichkeit über den gesamten Lebenszyklus dieses Artefakts erhalten bleiben.

Starten wir durch

Sollen wir uns das ansehen?

Erzählen Sie uns, was entstehen soll. Sie bekommen eine ehrliche Einschätzung zu Umfang, Zeitrahmen und Risiken — und eine klare Antwort, ob wir das richtige Team dafür sind.

Kostenloses Erstgespräch
Oder E-Mail senden

Antwort in der Regel innerhalb von 24 Stunden