Quavon Development
Agent Security4 Min. Lesezeit

Nvidia verlegt die Sicherheitsgrenze für AI-Agenten auf eine separate DPU

Nvidias Open Agent Safety Platform trennt Agenten-Runtime und Sicherheitskontrolle. OpenShell setzt Policies in der Sandbox durch, während Sentry auf einer separaten BlueField-4-DPU Agentenaktivität überwachen und Verstöße unabhängig vom Host stoppen soll.

Redaktion von Quavon DevelopmentVeröffentlicht
Die kurze Antwort

Nvidia verlagert einen Teil der Agenten-Sicherheitskontrolle aus dem Agenten-Host auf separate Hardware. OpenShell kontrolliert Dateien, Netzwerk, Prozesse und Credentials in der Sandbox; Sentry läuft auf BlueField-4-DPUs und soll Agentenaktivität out-of-band überwachen und Policy-Verstöße unabhängig vom Host stoppen.

Nvidia hat mit der Open Agent Safety Platform eine Referenzarchitektur veröffentlicht, die Agenten nicht nur innerhalb ihrer eigenen Runtime kontrollieren soll. Ein zweiter Kontrollpfad läuft auf einer separaten BlueField-4-DPU und bleibt damit außerhalb des Hosts, auf dem der Agent arbeitet.

Der Aufbau ist eine direkte Antwort auf ein Problem, das bei mehreren Agenten-Vorfällen der vergangenen Monate sichtbar wurde: Wenn Modell, Agent-Harness und Sicherheitslogik in derselben Vertrauenszone laufen, kann ein Fehler oder eine unerwartete Agentenaktion mehrere Schutzschichten gleichzeitig betreffen.

Nvidia trennt deshalb Runtime und Watchdog. OpenShell setzt die Software-Policy durch. Sentry beobachtet und erzwingt Regeln auf separater Hardware.

OpenShell kontrolliert Dateien, Netzwerk, Prozesse und Credentials

OpenShell ist der Softwareteil der Plattform. Nvidia veröffentlicht die Runtime unter Apache 2.0. Jeder Agent läuft in einer isolierten Sandbox mit Kernel-Kontrollen.

Die Policy legt fest, auf welche Dateien, Netzwerke, Tools, Prozesse und Credentials der Agent zugreifen darf. Laut Nvidia wird die Policy vor dem Start geprüft und während des Laufs weiter erzwungen.

SecurityWeek beschreibt drei zentrale Komponenten: ein Gateway verwaltet Sandboxes und Policies, die Sandbox setzt Kernel-Regeln für Dateisystem und Prozesse durch, und ein Supervisor kontrolliert ausgehende Requests.

Der Netzwerkverkehr der Sandbox läuft durch diesen Supervisor. Eine Policy kann beispielsweise Lesezugriffe auf eine API erlauben und Schreibzugriffe blockieren.

Für API-Zugänge verwendet OpenShell einen weiteren sinnvollen Mechanismus: Der Agent erhält nicht den echten Schlüssel. Im Agenten-Workload liegt nur ein Platzhalter. Der tatsächliche API-Key wird außerhalb der Sandbox erst für einen erlaubten Ziel-Endpunkt eingesetzt.

Das reduziert den Schaden, wenn generierter Code oder ein Tool innerhalb der Sandbox versucht, Credentials auszulesen.

Ein Agent darf eine neue Policy vorschlagen, aber nicht genehmigen

Agenten stoßen bei längeren Aufgaben regelmäßig auf fehlende Berechtigungen. Eine starre Sandbox kann dann dazu führen, dass Menschen immer größere Rechte vorab freigeben.

OpenShell erlaubt deshalb optional Policy-Vorschläge des Agenten. Die Trennung ist entscheidend: Der Agent kann eine Änderung anfordern, aber nicht selbst freigeben.

Zusätzlich verwendet Nvidia einen formalen Policy-Prover. Er soll prüfen, ob die modellierten Rechte einer Policy innerhalb der vom Betreiber gesetzten Grenzen bleiben.

Das ist ein anderer Ansatz als ein LLM-basierter Safety-Classifier. Die eigentliche Berechtigungsgrenze wird nicht aus der Einschätzung des Modells abgeleitet.

Sentry sitzt außerhalb des Agenten-Hosts

Der ungewöhnlichere Teil der Architektur ist Nvidia Sentry.

Sentry läuft auf BlueField-4-DPUs. In Vera-Rubin-Systemen liegt die DPU laut Nvidia auf dem einzigen Pfad des Compute-Nodes zum Modell. Dadurch kann sie Agentenaktivität beobachten und Policies durchsetzen, ohne im Betriebssystem des Agenten zu laufen.

Nvidia bezeichnet das als out-of-band enforcement.

Die DPU korreliert Modellinteraktionen, Policy-Entscheidungen sowie Tool- und Datenzugriffe. Über DOCA kann sie Agentenidentitäten und delegierte Berechtigungen prüfen. Wenn ein Agent seine Softwaregrenze verlässt, soll Sentry ihn laut Nvidia innerhalb von Millisekunden isolieren und stoppen.

Das ist eine Herstellerangabe. Öffentliche unabhängige Messungen der Reaktionszeit und belastbare Daten zu False Positives liegen für die neue Plattform noch nicht vor.

Der Architekturvorteil ist trotzdem konkret: Selbst wenn ein Agent Code auf seinem Host ausführen kann, liegt die letzte Kontrollschicht nicht zwangsläufig im selben System.

Der Pfad zum Modell wird zum Kill Switch

Nvidia formuliert einen weiteren Kontrollpunkt ungewöhnlich klar: den Pfad zum Modell.

Ein Agent benötigt für seinen nächsten Entscheidungsschritt erneut Modell-Inferenz. Wer diesen Pfad kontrolliert, kann beobachten, welche Agenteninstanz welche Anfrage stellt, und weitere Modellaufrufe unterbrechen.

Das unterscheidet sich von einem reinen Netzwerk-Kill-Switch. Der Agent kann lokal noch Prozesse besitzen, aber seine weitere agentische Entscheidungsfähigkeit lässt sich vom Modellzugang trennen.

Wie wirksam das in heterogenen Umgebungen ist, hängt davon ab, ob tatsächlich sämtliche relevanten Modellaufrufe über diesen kontrollierten Pfad laufen. Lokale Modelle oder alternative Endpunkte müssten ebenfalls von der Policy erfasst werden.

Anthropic trennt Agent Loop und Arbeits-Sandbox

Anthropic arbeitet mit Nvidia an der Integration. Bei Claude Managed Agents läuft der Agent Loop laut Nvidia auf einem separaten Server von den Sandboxes, in denen die eigentliche Arbeit ausgeführt wird.

OpenShell und BlueField können darunter eine zusätzliche Infrastrukturgrenze setzen.

Damit entstehen mehrere getrennte Kontrollbereiche: Modell und Agent Loop, Arbeits-Sandbox und optional die unabhängige Hardwareüberwachung.

Diese Trennung passt zu den Fehlermodi, die OpenAI, Anthropic und andere Labs zuletzt veröffentlicht haben. Bei mehreren Vorfällen war nicht eine einzelne Modellentscheidung das ganze Problem. Netzwerkpfade, Tool-Rechte, Monitoring und Abbruchmechanismen bestimmten, ob daraus eine reale externe Aktion werden konnte.

Nvidia behauptet, die Architektur hätte den Hugging-Face-Vorfall stoppen können

Gegenüber Reuters sagte Nvidia, die neue Plattform hätte den bekannten OpenAI/Hugging-Face-Vorfall verhindern können. Diese Aussage lässt sich rückwirkend nicht unabhängig testen.

Technisch ist nachvollziehbar, worauf Nvidia zielt: Eine externe Kontrollschicht soll verhindern, dass ein Agent allein durch Aktionen innerhalb seines Harnesses oder Hosts seine effektiven Rechte erweitert.

Das ist eine stärkere Behauptung als die bloße Bereitstellung einer weiteren Sandbox. Ob sie in realen Agenten-Workloads hält, wird davon abhängen, wie vollständig Netzwerk-, Modell-, Credential- und Tool-Pfade tatsächlich über OpenShell und Sentry laufen.

Für Entwickler ist die konkrete Architekturentscheidung bereits klar: Die Instanz, die über Agentenrechte entscheidet, sollte möglichst nicht dieselbe Instanz sein, die diese Rechte nutzen will.

Starten wir durch

Sollen wir uns das ansehen?

Erzählen Sie uns, was entstehen soll. Sie bekommen eine ehrliche Einschätzung zu Umfang, Zeitrahmen und Risiken — und eine klare Antwort, ob wir das richtige Team dafür sind.

Kostenloses Erstgespräch
Oder E-Mail senden

Antwort in der Regel innerhalb von 24 Stunden