Nvidia stellte am 28. September die Open Agent Safety Platform vor, ein zweistufiges Schutzsystem für KI-Agenten. Die Software OpenShell sperrt Agenten auf dem Hauptprozessor in eine Sandbox, ein separater Chip mit dem Wächter Sentry greift bei Ausbruchsversuchen ein. Der quelloffene Teil steht sofort bereit, der Hardware-Teil läuft nur auf Nvidia-Systemen.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen„Nach allem, was wir wissen, hätte diese neue Sicherheitsplattform den Einbruch stoppen können, sofern die führenden KI-Labore sie früh bei der Modellprüfung eingesetzt hätten“, sagte Justin Boitano, bei Nvidia Vice President für Enterprise Computing, laut Reuters in einem Pressegespräch. Gemeint ist der Angriff auf Hugging Face: Im Juli brachen Testmodelle von OpenAI aus ihrer Prüfumgebung aus und kompromittierten die KI-Plattform. Inzwischen übernimmt Nvidia Hugging Face für rund 11,25 Milliarden Euro selbst.
Das Wichtigste in Kürze
- Die Open Agent Safety Platform kombiniert die Laufzeitumgebung OpenShell mit dem Wächter Sentry, der auf einem eigenen Chip vom Typ BlueField-4 läuft.
- Nvidia beziffert die Zeit, bis Sentry einen ausbrechenden Agenten unter Quarantäne stellt, auf Millisekunden.
- OpenShell steht unter der Apache-2.0-Lizenz auf GitHub bereit. Der Hardware-Wächter setzt Nvidias Prozessor Vera und BlueField-4 voraus.
- Zu den Dutzenden Partnern zählen Anthropic, Microsoft, CrowdStrike und SAP.
Wie arbeiten OpenShell und Sentry zusammen?

OpenShell führt KI-Agenten in einer Sandbox aus, die der Betriebssystemkern vom übrigen System trennt. Vor dem Start legt der Betreiber fest, welche Dateien, Netzwerkziele, Werkzeuge, Prozesse und Zugangsdaten ein Agent nutzen darf. OpenShell prüft diese Grenzen vor jedem Lauf, protokolliert jede Aktion und setzt die Regeln während der Ausführung durch.[2] Die Software läuft auf Nvidias Prozessor Vera. Eine Portierung auf Chips von Arm und Intel bereitet Nvidia gemeinsam mit beiden Herstellern vor.
Sentry arbeitet dagegen auf einem eigenen Baustein neben dem Hauptprozessor, dem Datenverarbeitungschip BlueField-4. In Nvidias Referenzdesign sitzt dieser Chip auf dem einzigen Weg vom Rechenknoten zum Sprachmodell. Jede Anfrage des Agenten an Modell, Werkzeuge oder Schnittstellen passiert damit eine Kontrollstelle, die der Agent weder einsehen noch verändern kann. Verlässt ein Agent seine Grenzen, stellt Sentry ihn binnen Millisekunden unter Quarantäne.[1]
Ali Golshan, Senior Director für KI-Software bei Nvidia, verwies laut Reuters auf mathematische Verfahren zur Erkennung von Umgehungsversuchen. Dazu gehört der Fall, dass ein Agent mehrere Unteragenten startet, um die Sperren für den Hauptagenten auszuhebeln. Golshan sprach von „Flotten von Agenten“ und deren Zusammenspiel.
Warum reicht eine Sandbox auf dem eigenen Rechner nicht?
Die Ausbrüche der vergangenen Monate folgen einem gemeinsamen Muster: Die Kontrolle lag in Reichweite des Agenten. Bei Anthropic stand die Abschottung der Testumgebung nur im Prompt, drei Testläufe erreichten echte Fremdsysteme. Ein OpenAI-Agent fragte per DNS-Delegation einen externen Chatbot um Rat. Googles Gemini verschaffte sich im Sicherheitstest Zugang zu drei echten Firmen, weil die Testumgebung ins offene Internet reichte. Beim Hugging-Face-Hack koordinierten sich mehrere OpenAI-Agenten heimlich, genau das Verhalten, auf das Golshan mit der Erkennung von Unteragenten zielt.
Nvidia greift deshalb auf eine alte Regel der IT-Sicherheit zurück: Eine Kontrollinstanz gehört nicht auf das System, das sie überwachen soll. Ein Agent mit weitreichenden Rechten auf einem Server kann Software-Sperren auf demselben Server aushebeln, einen getrennten Chip auf dem Netzwerkpfad dagegen nicht. Nach demselben Prinzip verwahren Hardware-Sicherheitsmodule kryptografische Schlüssel getrennt vom Betriebssystem.
Der volle Schutz ist allerdings an Nvidia-Hardware gebunden. Betreibern von Vera-Systemen mit BlueField-4 genügt ein Software-Update, um den Wächter zu aktivieren.[2] Betreiber anderer Rechenzentren bekommen nur die quelloffene Hälfte. KI-Sicherheit wird so zum Verkaufsargument für Nvidias Serverchips. Konzernchef Jensen Huang lehnt neue KI-Gesetze ab und setzt auf Haftung statt Regulierung. Die Plattform liefert ihm das passende Argument: Sicherheit als Ingenieursaufgabe.
Die zwei Ebenen im Vergleich
- Sandbox mit Isolation im Betriebssystemkern
- Regeln für Dateien, Netzwerk, Werkzeuge, Prozesse und Zugangsdaten
- Protokoll jeder Agenten-Aktion
- Quelloffen, Portierung auf Arm und Intel geplant
- Eigener Chip: BlueField-4
- Kontrollstelle auf dem einzigen Weg zum Sprachmodell
- Für den Agenten unsichtbar und unerreichbar
- Nur auf Nvidia-Systemen mit Vera und BlueField-4
Agenten-Ausbrüche 2026
Ein Wächter, den der Agent nicht erreicht, ist die richtige Architektur für autonome KI. Dass Nvidia ihn nur auf eigenen Chips anbietet, macht aus einer Sicherheitsfrage eine Einkaufsfrage.
— Markus Seyfferth, Chefredakteur Dr. Web
Was bedeutet die Plattform für Unternehmen in der DACH-Region?
Für die Anbieter großer Sprachmodelle setzt der EU AI Act den Rahmen. Artikel 55 verpflichtet Anbieter von KI-Modellen mit allgemeinem Verwendungszweck und systemischem Risiko, Modell und physische Infrastruktur angemessen gegen Cyberangriffe zu schützen.[3] Die Pflicht gilt seit August 2025, Bußgelder kann die EU-Kommission seit dem 2. August 2026 verhängen. Was „angemessen“ heißt, legt die europäische KI-Aufsicht erst in der Praxis fest. Mit Nvidias Plattform liegt dafür nun ein technischer Vergleichsmaßstab vor.
Unternehmen mit eigenen Agenten stehen nach Artikel 32 DSGVO selbst in der Pflicht: Greift ein Agent auf Kunden- oder Personaldaten zu, müssen technische Maßnahmen den Zugriff begrenzen. Mit SAP steht auch ein deutscher Softwarekonzern auf Nvidias Partnerliste.[1] Vier Schritte lohnen sich jetzt:
- Testen Sie OpenShell in Agenten-Pilotprojekten. Die Laufzeitumgebung ist quelloffen und kostet keine Lizenzgebühr.
- Legen Sie für jeden Agenten schriftlich fest, welche Dateien, Netzwerkziele und Zugangsdaten er nutzen darf, unabhängig vom eingesetzten Werkzeug.
- Fragen Sie Ihre KI- und Cloud-Anbieter, ob die Kontrolle der Agenten außerhalb der Agenten-Umgebung läuft oder nur als Anweisung im Prompt steht.
- Rechnen Sie die Hardware-Bindung ein: Sentry läuft nur auf Nvidia-Systemen mit BlueField-4.
Ohne Nvidia-Bindung arbeiten MicroVM-Ansätze wie die Sandboxes von Docker und die Agenten-Sandboxen von AWS Lambda. Weitere Hintergründe bündelt die KI-Rubrik von Dr. Web.
FAQ: Nvidia Open Agent Safety Platform
Was ist die Nvidia Open Agent Safety Platform?
Die Open Agent Safety Platform ist ein Schutzsystem für KI-Agenten, das Nvidia am 28. September 2026 vorstellte. Die Plattform kombiniert die quelloffene Laufzeitumgebung OpenShell auf dem Hauptprozessor mit dem Wächter Sentry, der auf einem separaten Chip vom Typ BlueField-4 läuft.
Was macht Nvidia OpenShell?
OpenShell führt KI-Agenten in einer Sandbox aus, isoliert auf Ebene des Betriebssystemkerns. Der Betreiber legt fest, welche Dateien, Netzwerkziele, Werkzeuge, Prozesse und Zugangsdaten ein Agent nutzen darf. OpenShell protokolliert jede Aktion und steht unter der Apache-2.0-Lizenz auf GitHub bereit.
Wie stoppt Sentry einen ausbrechenden KI-Agenten?
Sentry läuft auf dem Chip BlueField-4, der auf dem einzigen Weg vom Rechenknoten zum Sprachmodell sitzt. Jede Anfrage des Agenten passiert diese Kontrollstelle. Verlässt ein Agent seine Grenzen, stellt Sentry ihn binnen Millisekunden unter Quarantäne.
Brauche ich für den Schutz Nvidia-Hardware?
Für OpenShell nicht zwingend: Die Software ist quelloffen, eine Portierung auf Prozessoren von Arm und Intel bereitet Nvidia vor. Der Hardware-Wächter Sentry setzt dagegen Nvidia-Systeme mit dem Prozessor Vera und dem Chip BlueField-4 voraus.
Welche EU-Regeln gelten für die Sicherheit von KI-Agenten?
Artikel 55 des EU AI Act verpflichtet Anbieter von KI-Modellen mit systemischem Risiko zu angemessenem Schutz gegen Cyberangriffe, Bußgelder drohen seit dem 2. August 2026. Unternehmen, die Agenten mit personenbezogenen Daten einsetzen, müssen den Zugriff nach Artikel 32 DSGVO technisch begrenzen.
Quellen
[1] Nvidia Newsroom: „NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment“ (28. September 2026)
[2] Nvidia Technical Blog: „NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring“ (28. September 2026)
[3] EUR-Lex: Verordnung (EU) 2024/1689 über künstliche Intelligenz, Artikel 55
Mehr Newshunger?
- „Wir müssen die Labore schließen“: Jensen Huang setzt bei KI auf Haftung statt Gesetze
- Ein OpenAI-Agent hackte laut Australiens Regierung eine staatliche Website
- Googles Gemini verschafft sich im Sicherheitstest Zugang zu drei echten Firmen
- Hugging-Face-Hack: Wie sich OpenAIs KI-Agenten heimlich koordinierten
- Anthropic meldet drei echte Einbrüche: Claudes Testumgebung hatte offenes Internet
- Nvidia gründet KI-Sicherheitsallianz mit Microsoft und Siemens