Salt Labs hat bei Manus eine indirekte Prompt Injection demonstriert, bei der eine präparierte E-Mail die Sicherheitsgrenze des Agenten überschritt. Nach Angaben der Forscher führte der Test bis zur Codeausführung in der Umgebung des betroffenen Nutzers. Anschließend konnten sie zeigen, dass auch Zugangsdaten verbundener Dienste innerhalb der erreichbaren Umgebung lagen.
Dark Reading veröffentlichte die Untersuchung am 24. September. Ein Missbrauch gegen reale Nutzer ist nicht dokumentiert.
Der technisch relevante Punkt liegt in der Reihenfolge der Kontrollen: Manus erkannte den erfolgreichen Angriff und zeigte eine Sicherheitswarnung. Die Warnung erschien nach Angaben von Salt Labs jedoch erst, nachdem die unerwünschte Aktion bereits ausgeführt worden war.
Externe Inhalte wurden Teil des Agentenkontexts
Der Test nutzte einen normalen Agenten-Workflow. Ein Nutzer verbindet sein E-Mail-Postfach mit Manus und lässt Nachrichten verarbeiten. Damit gelangen Inhalte in den Modellkontext, deren Absender der Nutzer nicht kontrolliert.
Salt Labs zeigte, dass manipulierte Inhalte innerhalb dieses Datenstroms das Verhalten des Agenten beeinflussen konnten. Eine einfache Variante wurde von Manus erkannt. Eine stärker verschleierte Variante passierte die vorgelagerte Erkennung und führte zur unerwünschten Aktion.
Damit ist die zentrale Sicherheitsfrage nicht, ob ein Agent Prompt Injection grundsätzlich erkennen kann. Entscheidend ist, ob eine gefährliche Aktion blockiert wird, bevor sie den Tool- oder Ausführungskontext erreicht.
Die Warnung kam nach der Aktion
Nach Angaben von Salt Labs erzeugte Manus auch beim erfolgreichen Test eine Warnung. Sie kam allerdings zu spät.
Bei einem Chatbot kann eine nachträgliche Erkennung zumindest verhindern, dass ein problematischer Inhalt weiter angezeigt oder gespeichert wird. Bei einem Agenten mit realen Tools ist die Reihenfolge strenger. Hat der Agent bereits Code ausgeführt, eine Datei verändert oder einen externen Dienst angesprochen, kann eine spätere Warnung die Aktion nicht rückgängig machen.
Security-Evaluierungen für Agenten sollten deshalb getrennt messen, ob ein Angriff erkannt und ob seine Auswirkung tatsächlich verhindert wurde. Eine hohe Detection Rate ist kein ausreichender Schutzwert, wenn die Entscheidung hinter dem Tool Call liegt.
Verbundene Dienste vergrößern die Schadensgrenze
Die Forscher konnten nach der Codeausführung nach eigenen Angaben auf Credentials beziehungsweise Tokens zugreifen, die zu mit Manus verbundenen Drittanbieterdiensten gehörten. Dark Reading nennt Gmail, Dropbox und GitHub als Beispiele für solche Integrationen.
Welche Daten und Aktionen in einem konkreten Account erreichbar wären, hängt von den tatsächlich verbundenen Diensten und deren Berechtigungen ab. Der Forschungsangriff zeigt dennoch eine klare Trust Boundary: Der Agent verarbeitet nicht vertrauenswürdige externe Daten und besitzt gleichzeitig privilegierte Zugänge im Namen des Nutzers.
Eine erfolgreiche Manipulation des Agenten kann dadurch mehr erreichen als eine falsche Textantwort. Die Berechtigungen des Agenten werden Teil der möglichen Auswirkung.
Agenten brauchen eine Kontrolle vor privilegierten Aktionen
Für die Architektur folgt daraus eine konkrete Trennung. Externe E-Mails, Webseiten und Dokumente sollten als untrusted Input behandelt werden, auch wenn ein Agent sie selbst abruft. Aus diesen Daten abgeleitete Aktionen dürfen nicht automatisch dieselbe Vertrauensstufe erhalten wie eine direkte Anweisung des Nutzers.
Privilegierte Tool Calls benötigen deshalb eine Kontrollschicht vor der Ausführung. Sie kann Herkunft des Inputs, Ziel der Aktion und benötigte Berechtigung berücksichtigen. Sensible Credentials sollten außerdem so isoliert sein, dass ein kompromittierter Agentenprozess nicht pauschal alle verbundenen Tokens lesen kann.
Der Manus-Fall zeigt auch, warum reine Prompt-Filter eine begrenzte Sicherheitsgrenze sind. Filter müssen unterschiedlich formulierte und verschleierte Eingaben bewerten, während eine externe Policy wesentlich einfacher entscheiden kann, ob ein bestimmter Agent in einem bestimmten Kontext eine bestimmte Aktion ausführen darf.
Kein bestätigter Angriff auf Manus-Nutzer
Salt Labs teilte die Ergebnisse nach Angaben von Dark Reading Manus mit, erhielt jedoch keine Antwort. Der Befund wurde außerdem über Metas Bug-Bounty-Prozess eingereicht. Dark Reading berichtet, Meta habe das Problem triagiert, bestätigt und gepatcht.
Die öffentlich verfügbare Berichterstattung nennt keine bestätigten Opfer und keinen Nachweis, dass die Schwachstelle außerhalb der Sicherheitsforschung ausgenutzt wurde. Sie erlaubt auch nicht den Schluss, dass jede aktuelle Manus-Umgebung weiterhin betroffen ist.
Für Agentenentwickler bleibt der gemessene Fehlermodus konkret: Ein Security-System kann einen Angriff korrekt als verdächtig erkennen und trotzdem zu spät reagieren. Bei autonomen Tools muss deshalb neben der Erkennung immer gemessen werden, ob die unerwünschte Aktion tatsächlich vor ihrer Ausführung gestoppt wurde.