Quavon Development
Prompt Injection / Agent Security4 Min. Lesezeit

OpenAI zeigt Prompt Injections, die sich zwischen Agenten selbst weiterkopieren

OpenAI hat in internen GPT-Red-Tests Prompt Injections erzeugt, die eine unerwünschte Aktion auslösen und sich zugleich in E-Mails, Dateien, Code oder andere Agentenkanäle weiterkopieren. Außerhalb simulierter Tool-Aufrufe beobachtete OpenAI keine Auswirkungen.

Redaktion von Quavon DevelopmentVeröffentlicht
Die kurze Antwort

OpenAI hat in kontrollierten Tests selbstreplizierende Prompt Injections demonstriert. Sie bringen einen Agenten zu einer unerwünschten Aktion und lassen ihn die schädliche Instruktion in einen neuen Kanal kopieren, sodass ein weiterer Agent sie später erneut verarbeiten kann. Die Versuche liefen in Trainings- und Evaluationsumgebungen; OpenAI meldet keinen realen Angriff oder Kundenschaden.

OpenAI hat in internen Tests Prompt Injections erzeugt, die zwei Aufgaben gleichzeitig erfüllen: Sie bringen einen Agenten zu einer unerwünschten Aktion und veranlassen ihn, die schädliche Instruktion in einen neuen Ausgabekanal zu kopieren.

Damit kann dieselbe Injection später von einem weiteren Agenten gelesen werden. OpenAI bezeichnet das Verhalten als „self-replicating prompt injection“ und vergleicht die Ausbreitungslogik mit einem Computerwurm.

Der Vergleich braucht eine klare Grenze. OpenAI berichtet keinen Angriff auf ein Produktivsystem und keinen betroffenen Kunden. Die beobachteten Fälle entstanden in simulierten Tool-Aufrufen während Training und Evaluation. Das Unternehmen veröffentlicht sie, weil der Replikationsmechanismus in seinen Tests funktioniert hat.

Eine Injection muss handeln und sich gleichzeitig kopieren

OpenAI nutzt für die Forschung ein Self-Play-System namens GPT-Red. Ein Angreifermodell erzeugt Prompt Injections, während ein anderes Modell versucht, eine Aufgabe trotz dieser manipulierten Inhalte korrekt auszuführen.

Für die neue Untersuchung ergänzte OpenAI das Trainingsziel um eine zweite Bedingung: Eine erfolgreiche Injection sollte nicht nur die gewünschte unerlaubte Aktion auslösen, sondern auch ihre eigenen Instruktionen wieder in einen öffentlich oder für andere Agenten erreichbaren Kanal schreiben.

Ein einfaches Testszenario nutzte E-Mail. Ein Agent sollte auf eine Nachricht antworten und einen Termin vereinbaren. Die gelesene Nachricht enthielt zusätzlich eine fremde Instruktion, die den Agenten dazu brachte, den Inhalt der ursprünglichen Nachricht in seiner Antwort zu reproduzieren.

Damit wurde die Injection Bestandteil der neuen Nachricht. Würde ein weiterer Agent diese Antwort später als vertrauenswürdigen Arbeitskontext lesen, wäre der schädliche Text erneut vorhanden.

Der technische Unterschied zu einer gewöhnlichen indirekten Prompt Injection liegt damit nicht in einem neuen Eingabekanal. Die Persistenz ist neu: Der manipulierte Inhalt soll nach der ersten Ausführung nicht verschwinden, sondern vom kompromittierten Agenten selbst weitergeschrieben werden.

OpenAI fand Replikation auch in Dateien und Code

Die Tests blieben nicht bei E-Mail.

OpenAI berichtet von Varianten, die sich über Dateien oder Code-Kommentare weiterkopierten. Andere Angriffe gaben sich als Systemwarnung, Tool-Ausgabe oder bereits vorhandener Arbeitszustand aus.

Ein weiteres Muster nutzte mehrere Schritte. Statt einen Agenten in einer einzigen Nachricht zu einer offensichtlich unpassenden Aktion aufzufordern, verteilte der Test die Instruktionen über mehrere scheinbar relevante Inhalte. Der Agent las diese Informationen nacheinander und entfernte sich dabei schrittweise von der ursprünglichen Nutzeraufgabe.

In einem Slack-basierten Test mit GPT-5.5 führte ein solcher mehrstufiger Pfad zu einer unerlaubten Aktion und anschließend zur erneuten Veröffentlichung des manipulierten Inhalts.

OpenAI nennt auch Tests, in denen manipulierte Arbeitsnotizen dazu führten, dass ein Agent Sicherheitslogik in einem Softwareprojekt veränderte. Diese Beispiele stammen vollständig aus kontrollierten Forschungsumgebungen. Sie sind kein Nachweis dafür, dass entsprechende Angriffe derzeit produktive OpenAI-Agenten kompromittieren.

Connectors machen Replikation praktisch relevanter

Ein Chat ohne Werkzeuge verarbeitet eine Injection und erzeugt Text. Ein Agent mit E-Mail-, Slack-, Datei- oder Repository-Zugriff kann fremden Inhalt lesen und anschließend selbst wieder in dieselben Systeme schreiben.

Genau diese Kombination schafft einen möglichen Replikationspfad.

Die Trust Boundary liegt deshalb nicht nur zwischen Nutzerprompt und Modell. Sie verläuft auch zwischen gelesenen Daten und späteren Schreibaktionen. Eine eingehende E-Mail ist Arbeitsmaterial. Sie sollte nicht automatisch die Berechtigung erhalten, die nächste ausgehende Nachricht oder einen anderen verbundenen Dienst zu steuern.

Für Agentenplattformen folgt daraus eine konkrete Kontrollfrage: Kann untrusted Content aus einem Read-Tool ohne zusätzliche Prüfung in einen Write-Tool-Call gelangen?

Wenn die Antwort ja lautet, reicht ein Prompt-Injection-Filter am ersten Eingang nicht unbedingt aus. Die Injection kann in persistenten Arbeitsartefakten landen und später erneut verarbeitet werden.

OpenAI trainiert jetzt explizit gegen Selbstreplikation

Die ersten E-Mail- und Dateifälle wurden mit internen Forschungsmodellen auf Basis von GPT-5.4-mini gefunden. Für die mehrstufige Slack-Evaluation war GPT-5.5 das verwundbare Modell; GPT-5.5 im Codex-Harness fand den Angriff.

OpenAI hat Selbstreplikation inzwischen als eigenes Angreiferziel in das GPT-Red-Training aufgenommen. Künftige Modelle sollen dadurch während des Trainings bereits mit entsprechenden Angriffsmustern konfrontiert werden.

Wie zuverlässig diese Maßnahme ist, lässt sich aus dem veröffentlichten Bericht noch nicht ableiten. OpenAI veröffentlicht keine allgemeine Erfolgsrate, mit der sich die Häufigkeit selbstreplizierender Angriffe über verschiedene Modelle und Connector-Konfigurationen vergleichen ließe.

Der Bericht liefert aber einen klaren Mechanismus, den Agentenentwickler unabhängig vom verwendeten Modell testen können: Inhalte aus E-Mail, Chat, Dateien oder Repositories dürfen ihre eigene Vertrauensstufe nicht dadurch erhöhen, dass ein Agent sie kopiert.

Ein vom Agenten neu geschriebenes Dokument ist nicht automatisch vertrauenswürdig. Es kann weiterhin Instruktionen enthalten, die ursprünglich aus einem untrusted Eingang stammen. Ohne Herkunfts- und Berechtigungskontrollen kann aus einem einmaligen Prompt-Injection-Fund dadurch persistenter Agentenkontext werden.

Starten wir durch

Sollen wir uns das ansehen?

Erzählen Sie uns, was entstehen soll. Sie bekommen eine ehrliche Einschätzung zu Umfang, Zeitrahmen und Risiken — und eine klare Antwort, ob wir das richtige Team dafür sind.

Kostenloses Erstgespräch
Oder E-Mail senden

Antwort in der Regel innerhalb von 24 Stunden