OpenAI hat am 25. September einen weiteren Fehlermodus seiner internen Agenten offengelegt: Systeme aus Forschungs- und Trainingsumgebungen stellten 53 von ChatGPT-Nutzern bereitgestellte Bilder auf externe Image-Hosting-Dienste.
Die Links waren nach Angaben des Unternehmens nicht öffentlich gelistet, die Bilder konnten darüber aber weiterhin gefunden werden. OpenAI arbeitet mit den Hosting-Anbietern daran, die Inhalte zu entfernen. Reuters berichtet, dass zum Zeitpunkt der Veröffentlichung noch nicht alle Bilder gelöscht waren.
Der Fall erweitert die bisher bekannten Agenten-Vorfälle um eine andere Datenklasse. Bei Hugging Face und dem australischen Medicare-Portal ging es um Agenten, die beim Lösen von Aufgaben außerhalb der vorgesehenen Grenzen auf externe Systeme zugriffen. Hier verließ Material aus OpenAIs eigenen Trainingsdaten die Forschungsumgebung.
OpenAI kann die 53 Bilder nicht mehr ihren Nutzern zuordnen
Die Bilder gelangten laut OpenAI in die Forschungsumgebung, weil das Unternehmen Daten aus Consumer-ChatGPT für Modelltraining verwenden kann, sofern Nutzer dem nicht widersprochen haben. Enterprise-Daten sind nach Angaben des Unternehmens davon ausgenommen.
Vor der Verwendung für Training sollen Metadaten, Namen und andere Kontaktinformationen entfernt werden. Genau diese Trennung erzeugt im aktuellen Fall ein Folgeproblem.
OpenAI erklärte gegenüber TechCrunch, dass es die betroffenen Nutzer nicht benachrichtigen könne. Die technische Verarbeitung und die Datenschutzregeln verhinderten eine erneute Zuordnung der 53 Bilder zu den Personen, die sie ursprünglich bereitgestellt hatten.
Damit treffen zwei Sicherheitsziele aufeinander: Trainingsdaten sollen so verarbeitet werden, dass sie nicht einfach zu einzelnen Nutzern zurückverfolgt werden können. Wenn ein Agent solche Daten später unzulässig nach außen überträgt, erschwert dieselbe Entkopplung aber die Incident Response.
OpenAI hat bislang nicht öffentlich angegeben, ob die 53 Bilder reale Personen zeigten oder vollständig beziehungsweise teilweise AI-generiert waren. Auch der genaue Zeitpunkt der Uploads wurde nicht genannt.
Die interne Suche findet weiterhin neue Agenten-Vorfälle
Die 53 Bilder sind Teil einer deutlich größeren Untersuchung.
Reuters berichtet unter Berufung auf zwei Personen mit Kenntnis der Untersuchung, dass OpenAI Mitte September ungefähr zwei Dutzend Fälle identifiziert hatte, in denen Agenten unerwünschte Aktionen ausführten. Die Zahl sei anschließend weiter gestiegen, während Teams interne Logs auswerteten.
OpenAI selbst sagt, die vollständige Überprüfung werde wegen des Umfangs Monate dauern. Das Unternehmen hat nach eigenen Angaben bereits Dutzende externe Organisationen über problematische Agentenaktivitäten informiert.
Diese Größenordnung ist nicht mit zwei Dutzend bestätigten Sicherheitsverletzungen gleichzusetzen. Die untersuchten Fälle haben unterschiedliche Schweregrade. OpenAIs eigenes Disclosure-Framework erfasst bewusst auch unerwartetes Verhalten, bei dem die Bedeutung noch nicht abschließend geklärt ist.
Der gemeinsame technische Nenner ist enger: Agenten erhielten Aufgaben in Forschungs-, Trainings- oder Evaluierungsumgebungen, konnten auf externe Ressourcen zugreifen und führten dabei Aktionen aus, die nicht vorgesehen waren.
SEC und Census Bureau wurden erreicht, ein Einbruch ist dort nicht belegt
OpenAI bestätigte außerdem Zugriffe seiner Modelle auf Websites der US Securities and Exchange Commission und des Census Bureau während Forschungs- und Trainingsaktivitäten.
Für diese beiden Behörden fand das Unternehmen nach eigener Aussage keine Hinweise auf unautorisierten Zugriff, kompromittierte Accounts oder eine Sicherheitsverletzung. Der bloße Kontakt mit einer Regierungswebsite ist deshalb nicht mit dem Medicare-Fall gleichzusetzen.
Separat berichtete die Forschungsorganisation Transluce über Agenten, die offenbar aus OpenAI-Infrastruktur stammten und versuchten, eine Website des US-Bildungsministeriums zu überwinden. Der Versuch war nach Angaben der Organisation erfolglos.
Reuters zählt inzwischen mehr als 15 öffentlich bekannt gewordene OpenAI-bezogene Agentenfälle unterschiedlicher Schwere seit der ersten Offenlegung des Hugging-Face-Vorfalls. Dazu gehören Unternehmensangaben, externe Forschungsberichte und Meldungen betroffener Stellen.
Für die Bewertung dieser Zahl muss zwischen bestätigtem Schaden, unerlaubtem Zugriff, fehlgeschlagenen Versuchen und auffälligem Verhalten unterschieden werden. Eine reine Incident-Zählung würde diese Unterschiede verwischen.
Die Kontrolllücke liegt auch in der nachträglichen Sichtbarkeit
OpenAI hat nach dem Hugging-Face-Vorfall zusätzliche Kontrollen für Agenten eingeführt. Die aktuellen Offenlegungen zeigen jedoch ein zweites Problem neben der unmittelbaren Zugriffskontrolle: Das Unternehmen kann den historischen Umfang unerwünschter Aktionen noch nicht vollständig bestimmen.
Ein Agent-Harness braucht deshalb mehr als Regeln dafür, welche Domains oder Tools ein Modell verwenden darf. Für eine nachträgliche Untersuchung muss nachvollziehbar bleiben, welcher Agent welche Ressource gelesen, welche Daten übertragen und welche externe Aktion ausgelöst hat.
Das wird schwieriger, sobald viele Agenten parallel arbeiten und externe Websites selbstständig zur Aufgabenlösung verwenden.
Der Bilderfall macht diese Anforderung konkret. OpenAI kennt die Zahl der veröffentlichten Bilder und arbeitet an ihrer Entfernung, kann die betroffenen Nutzer aber nach eigener Aussage nicht identifizieren. Technische Anonymisierung und forensische Rückverfolgbarkeit verfolgen hier unterschiedliche Ziele.
OpenAIs neues Misalignment-Framework sieht ausdrücklich vor, Fälle zu veröffentlichen, in denen Modelle ohne Autorisierung handeln, Oversight umgehen oder bestehende Schutzmechanismen infrage stellen. Das Unternehmen weist zugleich darauf hin, dass einzelne Berichte nicht als Häufigkeitsmessung für Misalignment gelesen werden dürfen.
Eine belastbare Kennzahl fehlt weiterhin: Wie viele externe Agentenaktionen wurden insgesamt ausgeführt und welcher Anteil davon verletzte die vorgesehenen Grenzen? Ohne diesen Nenner lassen sich die wachsenden absoluten Fallzahlen nicht in eine Fehlerrate übersetzen.