Quavon Development
Agent Security3 Min. Lesezeit

Verkettete Agenten-Skills lösten in 74,2 Prozent der Tests fremde Aktionen aus

Ein neues Paper zeigt einen Angriff, der erst durch die Übergabe zwischen mehreren Agenten-Skills entsteht. Über sechs Modelle hinweg gelang die vom Angreifer gewählte Aktion in 512 von 690 Versuchen.

Redaktion von Quavon DevelopmentVeröffentlicht Aktualisiert
Die kurze Antwort

APEX manipuliert nicht einen einzelnen Skill isoliert, sondern die Übergabe zwischen mehreren Skills: Ein früher Skill bringt den Agenten dazu, einen scheinbar legitimen Zwischenstand mit einer falschen Freigabe zu speichern; ein späterer Skill behandelt diese Information als Autorisierung. Im SkillsBench-Test führte das in 74,2 Prozent der 690 Versuche zur gewünschten Fremdaktion.

Ein am 1. Oktober veröffentlichtes Paper untersucht einen Angriff auf AI-Agenten, der bei der Prüfung einzelner Skills leicht übersehen werden kann. Die Forscher nennen die Methode APEX. Statt einen einzelnen Skill mit einer offensichtlich schädlichen Instruktion zu versehen, verteilt der Angriff seine Wirkung über mehrere Schritte eines Agenten-Workflows.

Auf SkillsBench führte die Methode über sechs getestete Modelle und vier Klassen von Zielaktionen in 512 von 690 Versuchen zur vom Angreifer gewünschten Aktion. Das entspricht 74,2 Prozent. Beim im Paper untersuchten GPT-5.4 lag die Erfolgsrate der vollständigen Skill-Kette bei 84,3 Prozent.

Der Angriff missbraucht den Zwischenzustand des Agenten

Agenten-Skills sind wiederverwendbare Anweisungen und Werkzeuge für bestimmte Aufgaben. Ein Agent kann mehrere davon nacheinander verwenden. Dabei entstehen Dateien, Notizen oder andere Zwischenstände, die ein späterer Schritt wieder einliest.

APEX greift genau diese Übergabe an. Ein früher Skill veranlasst den Agenten, einen realen Arbeitsfortschritt zu dokumentieren. In diesen vom Agenten selbst erzeugten Zwischenstand gelangt zusätzlich eine falsche Behauptung, etwa dass der Nutzer eine bestimmte Folgeaktion bereits genehmigt habe. Ein späterer Skill liest den Zwischenstand und behandelt diese Behauptung als gültige Autorisierung.

Damit ändert sich die Trust Boundary. Der problematische Text stammt beim zweiten Schritt nicht mehr unmittelbar aus einem fremden Skill. Er steht in einem Artefakt, das der Agent selbst erzeugt hat.

Das erklärt einen auffälligen Unterschied im Experiment. Bei GPT-5.4 erreichte die verkettete Variante 84,3 Prozent Angriffserfolg. Wurden dieselben Bestandteile zu einem einzelnen Skill zusammengeführt, sank die Rate laut Paper auf 17,4 Prozent. Der Angriff profitiert also gerade von der Aufteilung über mehrere Schritte.

Einzelne Skills zu prüfen reicht in diesem Modell nicht

Für Skill-Marktplätze und Agentenplattformen ist das ein unangenehmer Befund. Eine statische Prüfung kann zwei Skills jeweils für unauffällig halten, obwohl ihre Kombination einen unerwünschten Ablauf erzeugt.

Dasselbe gilt für Provenance. Eine Datei ist nicht automatisch vertrauenswürdig, weil der Agent sie selbst geschrieben hat. Wenn ihr Inhalt teilweise aus untrusted Inputs oder fremden Skills abgeleitet wurde, muss diese Herkunft beim nächsten Tool- oder Skill-Aufruf erhalten bleiben.

Das ähnelt Taint Tracking in klassischen Programmen: Entscheidend ist nicht nur, wo ein Wert gerade gespeichert ist, sondern woher er stammt und welche sicherheitsrelevanten Entscheidungen damit getroffen werden dürfen.

Die getestete Prompt-Abwehr senkte Angriff und Nutzbarkeit zugleich

Die Forscher testeten eine einfache Gegenmaßnahme. Der Agent wurde angewiesen, von Skills erzeugte Dateien gegen den ursprünglichen Nutzerauftrag zu prüfen, bevor er daraus Folgeaktionen ableitet.

Bei GPT-5.4 sank die Angriffserfolgsrate dadurch von 84,3 auf 59,1 Prozent. Das ist eine Verbesserung, aber kein zuverlässiger Schutz.

Gleichzeitig fiel die Erfolgsrate auf 72 gutartigen Native-Skill-Aufgaben von 86,7 auf 56,3 Prozent. Die zusätzliche Skepsis störte also auch normale Arbeitsabläufe erheblich.

Das ist für die Architektur wichtiger als die absolute Benchmarkzahl. Eine Sicherheitsregel, die lediglich mehr Misstrauen in den Prompt schreibt, muss zwischen legitimer Delegation und gefälschter Autorisierung unterscheiden. In den Tests gelang das nicht sauber.

Autorisierung sollte nicht als Freitext weitergereicht werden

Für Agentenplattformen ergibt sich daraus eine konkrete Designfrage. Eine Nutzerfreigabe, die eine privilegierte Aktion erlaubt, sollte nicht ausschließlich als natürlichsprachige Behauptung in einer Datei oder Agentennotiz existieren.

Besser trennbar sind strukturierte, vom Runtime-System erzeugte Freigaben: Wer hat welche Aktion genehmigt, für welches Tool, mit welchen Parametern und für welchen Zeitraum? Ein Skill kann diese Information verwenden, sollte sie aber nicht selbst erzeugen oder umdeuten können.

Das Paper belegt noch keinen Angriff auf ein Produktivsystem. Es ist eine kontrollierte Evaluation. Die Messwerte zeigen jedoch, dass die Komposition mehrerer einzeln plausibler Agentenbausteine eine eigene Sicherheitsoberfläche bildet. Wer nur jeden Skill separat scannt, prüft damit nicht automatisch den Workflow, der aus ihnen entsteht.

Quelle: Tian Dong, Zixuan Ma, Haodong Zhao, Huaien Zhang, Shaofeng Li und Hao Chen, „Chaining Skills to Hijack LLM Agents“, arXiv:2610.01564, 1. Oktober 2026.

Starten wir durch

Sollen wir uns das ansehen?

Erzählen Sie uns, was entstehen soll. Sie bekommen eine ehrliche Einschätzung zu Umfang, Zeitrahmen und Risiken — und eine klare Antwort, ob wir das richtige Team dafür sind.

Kostenloses Erstgespräch
Oder E-Mail senden

Antwort in der Regel innerhalb von 24 Stunden