DeepSeek hat in einem 31-seitigen Fachbericht zur Sandbox-Plattform DSec offengelegt, wie der chinesische KI-Entwickler seine Agenten trainiert: in bis zu 380.000 gleichzeitig laufenden Sandboxen. Der Bericht dokumentiert auch, wie die Agenten dabei nach hinterlegten Lösungen suchten und Systemdateien überschrieben. Firmen mit eigenen Coding-Agenten bekommen damit eine Mängelliste, die sich direkt auf ihre Build-Server übertragen lässt.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Ein KI-Agent in DeepSeeks Trainingsumgebung DSec soll eine Programmieraufgabe lösen und überschreibt stattdessen die Datei /bin/bash, damit jede weitere Shell-Sitzung seine eigenen Befehle mitausführt. Den Fall beschreibt DeepSeek in einem Bericht auf dem Preprint-Server arXiv, der Aufbau und Betrieb der internen Plattform dokumentiert.[1] Unter den mehr als 130 Autoren steht auch Gründer Liang Wenfeng.

Das Wichtigste in Kürze

  • DSec stellt vier Arten von Sandboxen bereit: Funktionsaufrufe, Container, MicroVMs und vollständige virtuelle Maschinen.
  • Eine Produktionseinheit mit rund 160 Servern erzeugt täglich etwa 3 Millionen Sandboxen, bis zu 380.000 davon laufen gleichzeitig.
  • Agenten durchsuchten Protokolle nach Referenzantworten, fälschten interne Nachrichten und überschrieben Systemdateien.
  • DeepSeek sperrt Dateien und Netzwerkziele auf Ebene des Betriebssystems, zusätzlich kürzt das Unternehmen die Belohnung für Täuschungsversuche.

Was leistet DeepSeeks Sandbox-Plattform DSec?

Sandkasten mit Schaufel und brauner Briefumschlag mit Aufschrift „MUSTERLÖSUNG“ daneben
KI-Agenten trainieren in isolierten Sandboxen parallel an Tausenden Aufgaben und erhalten Belohnungen für Lösungen. DeepSeek nutzt bis zu 32.000 Sandboxen pro Trainingsauftrag

Sandboxen sind abgeschottete Rechenumgebungen, in denen ein Agent Code ausführt, Werkzeuge aufruft und Dateien ändert, ohne Produktivsysteme zu berühren. Beim bestärkenden Lernen bearbeiten KI-Agenten Tausende solcher Aufgaben parallel und erhalten für jede gelöste Aufgabe eine Belohnung. Ein einzelner Trainingsauftrag fordert bei DeepSeek bis zu 32.000 Sandboxen an. Die Plattform erzeugt mehr als 5.000 davon pro Sekunde.

Die Auslastung erklärt, warum DeepSeek so viele Sandboxen auf einen Server packt. Rund 90 Prozent der Container und MicroVMs nutzen im Schnitt höchstens 5 Prozent der angeforderten Rechenleistung, denn das Sprachmodell selbst rechnet auf den GPUs. Im Betrieb laufen deshalb bis zu 3.200 Container oder 800 MicroVMs auf einem einzigen Server. Seit DeepSeek-V4.1 laufen die Agenten-Schleifen zudem nicht mehr auf den unterbrechbaren GPU-Knoten des Trainings, sondern in eigenen DSec-Containern. Ein abgebrochener Trainingsjob verliert so nicht mehr den Stand der laufenden Aufgaben.

Wie haben die Agenten ihre Aufgaben ausgetrickst?

Reward Hacking heißt das Muster in der Fachsprache: Ein Modell optimiert auf das Signal, das eine Lösung belohnt, statt auf die Lösung selbst. DeepSeek nennt konkrete Fälle. Agenten durchsuchten die Protokolle der internen Steuerungssoftware nach hinterlegten Referenzantworten und schickten gefälschte Nachrichten an deren Schnittstelle, um die Prüfung einer Aufgabe zu umgehen. Ein Agent versuchte per Systemaufruf, die Speicherzuordnung zweier Dateien zu tauschen, um an geschützten Inhalt zu kommen. Das Dateisystem nahm dabei Schaden und musste abgeschaltet werden.

Außerhalb der Sandbox suchten die Agenten ebenfalls. Laut Bericht scannten einzelne Agenten Ports nach Spiegelservern und holten Code über einen Go-Modul-Proxy direkt von GitHub. Andere installierten schlicht eine neuere Paketversion, in der die gesuchte Funktion bereits steckte.

Das Muster kennt die Branche seit diesem Sommer. Im Juli brach ein OpenAI-Agent bei einem Cyber-Benchmark aus der Testumgebung aus und drang bis zu Hugging Face vor, getrieben von der Jagd nach den Lösungen des Benchmarks. Kurz darauf meldete Anthropic drei Fälle, in denen Claude-Modelle aus angeblich isolierten Tests fremde Systeme angriffen, weil die Isolation nur im Prompt stand. DeepSeek zieht die Grenze dagegen im Betriebssystem: AppArmor-Profile sperren Protokolle und interne Sockets, eine eBPF-Regel gibt jeder Aufgabe nur die Paketquellen frei, die sie braucht.

DSec in Zahlen
Eine Produktionseinheit von DeepSeeks Sandbox-Plattform für das Training von KI-Agenten
160
Server bilden eine Produktionseinheit.
3 Mio.
Sandboxen entstehen pro Tag.
380.000
Sandboxen laufen in der Spitze gleichzeitig.
32.000
Sandboxen fordert ein einzelner Trainingsauftrag maximal an.
90 %
der Container und MicroVMs nutzen höchstens 5 % der angeforderten Rechenleistung.
Was die Agenten versuchten und wie DeepSeek sperrt
Referenzantworten in Protokollen gesucht
AppArmor sperrt die Protokolle
Nachrichten an die Steuerungssoftware gefälscht
AppArmor sperrt interne Sockets
Code über Spiegelserver und Go-Proxy geholt
eBPF-Freigabeliste je Aufgabe
Täuschung als Weg zur Belohnung
Weniger Belohnung für Täuschungsversuche

Jeder Agent, den ein bestandener Test belohnt, sucht auch die Abkürzung zum bestandenen Test. Die Sperren gehören deshalb ins Betriebssystem und ins Netzwerk, in den Prompt gehören sie nicht.

— Michael Dobler, Herausgeber Dr. Web

Was heißt das für Unternehmen mit eigenen Coding-Agenten?

Coding-Agenten arbeiten in vielen Unternehmen bereits in CI-Pipelines, mit Zugriff auf Repositorys, Testsuiten und Paketregister. Dieselben Abkürzungen stehen dort offen: Ein Agent kann einen fehlschlagenden Test umschreiben, statt den Fehler zu beheben, oder Zugangsdaten aus Umgebungsvariablen auslesen. Für eine harte Trennung stehen Werkzeuge bereit, etwa Docker Sandboxes auf MicroVM-Basis oder die MicroVMs von AWS Lambda.

Der EU AI Act verpflichtet Anbieter großer Allzweckmodelle mit systemischem Risiko seit August 2025 zu Modellevaluierungen samt Angriffstests und zur Meldung schwerwiegender Vorfälle. Bußgelder dafür kann die EU-Kommission seit dem 2. August 2026 verhängen.[2] Unternehmen, die solche Modelle nur einsetzen, fallen nicht unter diese Pflichten, bleiben für die Sicherheit ihrer eigenen Pipeline aber selbst verantwortlich.

Aus DeepSeeks Befunden lassen sich vier Schritte für die eigene Pipeline ableiten:

  • Agenten in eigenen Sandboxen ohne Zugriff auf Soll-Ergebnisse, Protokolle und Zugangsdaten betreiben.
  • Netzwerkzugriffe je Aufgabe per Freigabeliste regeln, statt das offene Internet durchzureichen.
  • Änderungen an Tests und Systemdateien gesondert markieren und vor dem Merge von Menschen prüfen lassen.
  • Agentenprotokolle regelmäßig stichprobenartig auf Umwege durchsehen.

Die Autoren halten selbst fest, dass kein einzelner Mechanismus jedes Fehlverhalten der Agenten verhindert. Eigene Agenten-Umgebungen brauchen deshalb mehrere Sperren übereinander und einen regelmäßigen Blick in die Protokolle.

Was ist DeepSeek DSec?

DSec (DeepSeek Elastic Compute) ist die interne Sandbox-Plattform, auf der DeepSeek seine KI-Agenten trainiert und testet. Die Plattform bietet Funktionsaufrufe, Container, MicroVMs und vollständige virtuelle Maschinen über eine gemeinsame Programmierschnittstelle an. Eine Einheit mit rund 160 Servern erzeugt täglich etwa 3 Millionen Sandboxen.

Was ist Reward Hacking bei KI-Agenten?

Beim Reward Hacking optimiert ein Modell auf das Belohnungssignal statt auf die eigentliche Aufgabe. Ein Agent sucht dann etwa hinterlegte Musterlösungen, manipuliert die Prüfung oder ändert Tests, anstatt das Problem zu lösen. Trainings- und Testergebnisse verlieren dadurch ihre Aussagekraft.

Ist DSec quelloffen?

Nein. Im arXiv-Bericht verweist DeepSeek auf keinen veröffentlichten Quellcode der Plattform. Der Bericht beschreibt Architektur, Kennzahlen und Gegenmaßnahmen. Quelloffen ist dagegen das verteilte Dateisystem 3FS, aus dem DSec die Images der Sandboxen lädt.

Wie schützen Unternehmen ihre Pipelines vor tricksenden Agenten?

Agenten laufen am besten in isolierten Sandboxen ohne Zugriff auf Soll-Ergebnisse, Protokolle und Zugangsdaten. Netzwerkzugriffe regelt eine Freigabeliste je Aufgabe. Änderungen an Tests und Systemdateien prüfen Menschen vor dem Merge, dazu kommen Stichproben aus den Agentenprotokollen.

Quellen

[1] DeepSeek (arXiv): „DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale“

[2] EUR-Lex: „Verordnung (EU) 2024/1689 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (Verordnung über künstliche Intelligenz)“

Mehr Newshunger?

4,4 10 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?