Anthropic hat erstmals konkrete Betriebsdaten zu seiner internen Agentenplattform veröffentlicht. Nach Angaben des Unternehmens arbeiteten im August 2026 auf der meistgenutzten internen Plattform zu einem beliebigen Zeitpunkt rund 30.000 AI-Agenten an Forschung und Engineering.
Anthropic beschreibt zwei getrennte Kontrollpfade: einen Online-Monitor, der Aktionen vor der Ausführung prüft, und einen Offline-Monitor, der abgeschlossene Aktivitäten nachträglich analysiert.
Auf dieser Plattform sollen 100 Prozent der Agentenaktionen den Online-Monitor passieren. Für August wertete das Unternehmen mehr als eine Milliarde Entscheidungen aus. 0,002 Prozent wurden blockiert oder umgelenkt – ungefähr eine von 47.000 Entscheidungen.
Die Messungen stammen von Anthropic selbst. Reuters und Associated Press haben die Kerndaten aufgegriffen. Eine externe Reproduktion der Messung gibt es bislang nicht.
Claude „führt“ 26 Prozent der R&D-Arbeit
Die Monitoring-Daten sind Teil eines größeren Berichts darüber, wie stark AI inzwischen an Anthropics eigener Modellforschung beteiligt ist.
Dafür verwendet das Unternehmen eine Automatisierungsskala von AL0 bis AL5, die auf einer Methodik von Epoch AI basiert. AL3 bedeutet, dass ein Modell größere Arbeitspakete unter enger menschlicher Anleitung erledigt. Bei AL4 „führt“ das Modell eine Aufgabe: Es kann den größten Teil ausgehend von einem übergeordneten Auftrag erledigen, während ein Mensch weiter beaufsichtigt.
Nach Anthropics Auswertung lagen im August 26 Prozent der internen AI-R&D-Arbeit auf diesem AL4-Niveau. Mehr als 90 Prozent der Arbeit lagen mindestens auf AL3.
Anthropic betont ausdrücklich, dass Claude in keinem der gemessenen Bereiche vollständig autonom arbeitet. Die Zahlen beschreiben eine Organisation, in der große Teile der Arbeit an Agenten delegiert werden und Menschen häufiger beaufsichtigen, prüfen und eingreifen.
Bei dieser Größenordnung reichen sehr niedrige Fehlerraten aus, um regelmäßig reale Fälle zu erzeugen. Genau deshalb veröffentlicht Anthropic neben dem Automatisierungsgrad auch Daten darüber, wie oft die Kontrollsysteme eingreifen.
Der Online-Monitor sitzt vor jeder Aktion
Anthropic trennt zwischen Fehlern, die sofort Schaden verursachen könnten, und Verhaltensmustern, die erst über längere Zeit sichtbar werden.
Der Online-Monitor prüft laut Unternehmen jede Aktion vor der Ausführung. Er soll vor allem irreversible oder schwer rückgängig zu machende Aktionen stoppen. Anthropic nennt als Beispiel einen Agenten, der Modellgewichte aus internen Systemen kopieren will.
Der Offline-Monitor arbeitet nach der Ausführung. Er liest Agentenaktivitäten im Nachhinein und sucht unter anderem nach längerfristigen Mustern, die auf Fehlverhalten oder Misalignment hindeuten könnten.
Nach Anthropics Angaben werden dabei ungefähr 100.000 Transkripte pro Woche markiert. Weitere Klassifikatoren filtern einen Großteil dieser Treffer. Ungefähr 50 Fälle pro Woche werden schließlich an Menschen eskaliert.
Damit kontrolliert der Monitor nicht nur Textausgaben. Er sitzt im Ausführungspfad eines Systems, das Werkzeuge verwendet und Aufgaben über längere Zeit fortsetzt.
Agenten bekommen eine Identität, die Modellwechsel überlebt
Im methodischen Teil beschreibt Anthropic eine weitere Designentscheidung: interne Agenten besitzen eine eigene Identität.
Diese Identität ist nicht an eine konkrete Modellversion gekoppelt. Wird das zugrunde liegende Modell aktualisiert, bleibt die Agentenidentität bestehen. Daten, Nachrichten und Aktionen lassen sich dadurch weiter demselben Agenten zuordnen.
Anthropic begründet das auch mit Multi-Agenten-Systemen. Wenn ein Agent eine Nachricht eines anderen Agenten liest, soll er diese Information als fremde Behauptung behandeln können und nicht wie einen eigenen früheren Gedanken.
Die Agenten kommunizieren nach Unternehmensangaben über ein gemeinsames Messaging-System. Nachrichten sind mit Absendern und Originalquellen verknüpft; die Kommunikation kann auf die zugehörigen Agententranskripte zurückgeführt werden.
Für eine Untersuchung ist das praktisch: Sie kann verfolgen, welcher Agent eine Information erzeugt hat, wie sie weitergegeben wurde und welche Aktionen daraus entstanden.
Eine niedrige Blockrate misst nicht die False Negatives
Eine Blockrate von einer Entscheidung auf 47.000 beantwortet nicht, wie viele problematische Aktionen der Monitor übersehen hat.
Anthropic nennt diese Grenze selbst. Das Unternehmen fordert, Monitoring-Systeme von unabhängigen Dritten mit bekannten Fehlverhaltensfällen zu testen und nicht nur interne Block- und Eskalationsraten zu veröffentlichen.
Auch der R&D-Automatisierungsindex ist keine externe Messung. Anthropic verwendet Claude-Agenten, um interne Arbeitsaufzeichnungen auszuwerten und den Automatisierungsgrad einzelner Aufgaben zu bestimmen. Ein unabhängiger Claude-Judge vergibt anschließend die Einstufung. Das Unternehmen weist darauf hin, dass Prüfer und geprüftes System dadurch ähnliche Fehler machen könnten.
Für einen Vergleich zwischen Labs bräuchte es gemeinsame Messmethoden und externe Audits. Bis dahin sind vor allem die Rohdaten nützlich: rund 30.000 gleichzeitig aktive Agenten, mehr als eine Milliarde untersuchte Entscheidungen, vollständiges Online-Monitoring laut Betreiber und ungefähr 50 Offline-Fälle pro Woche, die bis zur menschlichen Prüfung eskaliert werden.
Die offene Kennzahl ist die Erkennungsrate des Monitors gegen bekannte problematische Agentenaktionen. Ohne sie lässt sich aus der niedrigen Blockrate nicht ableiten, wie zuverlässig das System tatsächlich kontrolliert.