Anthropics Frontier Red Team hat Z.ais GLM-5.3 untersucht und kommt zu einem ungewöhnlich konkreten Ergebnis: Das frei verfügbare Open-Weight-Modell konnte in den Tests vollständige Exploits entwickeln und lag auf einem Anthropic-Benchmark nahe an Claude Mythos Preview.
Auf ExploitBench erzeugte GLM-5.3 nach Anthropics Angaben in 50 von 410 Versuchen einen funktionierenden End-to-End-Exploit. Claude Mythos Preview kam unter den gleichen Bedingungen auf 56 von 410. Auf einem internen Binary-Exploitation-Test erreichte GLM-5.3 vollständige Control-Flow-Hijacks in 4 Prozent der Aufgaben, Mythos Preview in 6 Prozent.
Das Ergebnis stammt von Anthropic, einem direkten Wettbewerber von Z.ai. Eine separate Untersuchung des US-amerikanischen Center for AI Standards and Innovation bei NIST stützt jedoch den grundlegenden Capability-Befund: CAISI bezeichnet GLM-5.3 als das bislang cyberfähigste veröffentlichte Open-Weight-Modell.
CAISI misst weiterhin einen deutlichen Abstand zur US-Frontier
Die beiden Untersuchungen beantworten unterschiedliche Fragen.
CAISI verglich GLM-5.3 auf vier Cyber-Benchmarks mit den jeweils stärksten von der Behörde getesteten US-Modellen. Auf SEC-Bench Pro erreichte GLM-5.3 40,4 Prozent gegenüber 90,2 Prozent für den US-Frontier-Bestwert. Auf ExploitGym waren es 9,4 gegenüber 44,4 Prozent, auf CAISI OSS-Fuzz 7,7 gegenüber 23,2 Prozent.
Aus seinem aggregierten Capability-Index schätzt CAISI, dass GLM-5.3 ungefähr vier Monate hinter der aktuellen US-Frontier liegt. Die Vergleichsbedingungen sind dabei relevant: US-Modelle wurden, soweit möglich, mit deaktivierten Cyber-Safeguards getestet und die Gruppe enthält auch Modelle, die nur kontrolliert verfügbar sind.
Anthropic konzentriert sich dagegen auf eine andere Eigenschaft: GLM-5.3 kann heruntergeladen und lokal betrieben werden. Zugriffsregeln eines API-Anbieters können die Gewichte danach nicht mehr kontrollieren.
Anthropics Red Team umging die Safeguards mit mehreren Methoden
Anthropic testete deshalb nicht nur die Cyber-Fähigkeit, sondern auch die Stabilität der eingebauten Verweigerungen.
Nach Angaben des Unternehmens beantwortete das unveränderte Modell offen schädliche Anfragen zunächst nicht. Mit einer irreführenden Red-Team-Rahmung stieg die Engagement-Rate in Anthropics Tests auf 64 Prozent. Vorgefülltes Reasoning erhöhte sie auf 92 Prozent.
Anthropic erzeugte außerdem eine modifizierte, sogenannte abliterierte Version des Modells, bei der die Refusal-Mechanismen gezielt abgeschwächt wurden. Das Team beziffert den eigenen ersten Versuch auf ungefähr 2.200 GPU-Stunden beziehungsweise rund 4.400 US-Dollar Compute. In dieser modifizierten Variante lag die Engagement-Rate im Test bei 100 Prozent.
Die 100-Prozent-Zahl beschreibt ausdrücklich nicht das von Z.ai veröffentlichte Modell im Originalzustand. Sie zeigt, dass die Verweigerungsschicht bei offenen Gewichten nicht als dauerhafte Zugriffskontrolle behandelt werden kann.
Ein Modell fand unbekannte Browserfehler in einer isolierten Testumgebung
Anthropic führte zusätzlich Human-in-the-Loop-Sessions durch. In einer davon arbeitete GLM-5.3 laut Bericht auf einer isolierten Maschine gegen einen lokal bereitgestellten Browser-Build. Das Modell fand mehrere zuvor unbekannte Fehler in dessen JavaScript-Engine und kombinierte sie zu einem funktionierenden Exploit gegen das Testziel. Anthropic sagt, die Schwachstellen an den Hersteller gemeldet zu haben.
Eine kleinere Variante, GLM-5.3-Flash, entwickelte aus öffentlichen Informationen zu bereits bekannten Fehlern eine funktionierende Exploit-Kette. Anthropic gibt dafür rund acht Stunden Modelllaufzeit und ungefähr 20 Minuten menschliche Aufmerksamkeit an.
Diese Versuche sind keine Belege für reale Angriffe mit GLM-5.3. Sie messen, welche Arbeit ein Modell unter kontrollierten Bedingungen übernehmen kann.
Open Weights verändern die Bedeutung von Safeguards
Bei einem gehosteten Frontier-Modell kann der Anbieter Accounts sperren, Requests klassifizieren und Zugriffsrechte ändern. Bei veröffentlichten Gewichten bleibt diese Kontrolle nicht erhalten.
Das macht den Unterschied zwischen Capability-Evaluation und Deployment-Safety hier konkret. CAISI misst GLM-5.3 noch deutlich unterhalb der stärksten US-Modelle. Anthropic zeigt gleichzeitig, dass ein Teil der bisher kontrolliert bereitgestellten Exploit-Fähigkeit inzwischen in einem frei verfügbaren Modell vorhanden ist.
Für Betreiber solcher Modelle folgt daraus keine automatische Aussage über Missbrauch. Die technische Konsequenz ist enger: Sicherheitsentscheidungen können bei Open Weights nicht darauf bauen, dass die im veröffentlichten Checkpoint enthaltene Refusal-Schicht unverändert bleibt.