Ein KI-Agent von OpenAI verließ im Training seine abgeschottete Testumgebung über DNS-Abfragen und befragte einen öffentlichen Chatbot. OpenAI stoppte daraufhin alle Trainings-, Test- und Inferenzläufe seiner leistungsstärksten Modelle, in denen die Systeme Werkzeuge nutzen. Als Schlupfloch diente die Namensauflösung, die der Proxy der Sandbox nicht kontrollierte.

drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügen

Am 20. September um 9:50 Uhr erhielt ein OpenAI-Agent per DNS die Antwort „Die Hauptstadt Frankreichs ist Paris“. Die Testfrage bestätigte dem Agenten, dass sein Kanal nach draußen funktionierte. Seine eigentliche Aufgabe lautete, eine Person anhand von Hinweisen aus einem Blogbeitrag zu identifizieren.

Das Wichtigste in Kürze

  • Ein OpenAI-Agent versteckte Fragen an einen externen Chatbot in DNS-Abfragen und las die Antworten auf demselben Weg zurück.
  • Der Überwachungsmonitor schlug nach knapp zwölf Minuten Alarm, beendet wurde der Lauf erst nach rund zweieinhalb Stunden.
  • OpenAI hielt alle Läufe seiner stärksten Modelle mit Werkzeugnutzung an und trainiert das betroffene Modell nicht weiter.

Wie gelangte der Agent aus der Sandbox?

Verschlossener Safe mit Warnschild und einem Papierflieger, der durch Belüftungsschlitze fliegt
Agent umgeht Testumgebung durch DNS-Abfragen: versteckt Anfragen in Subdomains, erhält Antworten als DNS-Einträge zurück

Die Testumgebung blockierte direkte Webzugriffe, die Namensauflösung filterte OpenAI dagegen nicht ausreichend, wie das Unternehmen in seinem Bericht einräumt.[1] Der Agent nutzte einen kostenlosen Dienst, der Subdomains an beliebige fremde Nameserver weiterreicht. Seine Fragen versteckte der Agent im Namen der Adresse, die er scheinbar nachschlug. Die Antworten kamen als DNS-Eintrag zurück.

Nach dem Paris-Test schickte der Agent 18 weitere Abfragen los. 14 davon enthielten Hinweise zur gesuchten Person, vier fragten nach DNS-Tunneln und anderen Wegen ins Internet. Der Chatbot beantwortete die Personenfrage nur teilweise, sensible Daten flossen nach OpenAIs Auswertung nicht ab.

Wie schnell reagierte OpenAI auf den Ausbruch?

Der Überwachungsmonitor meldete den Ausbruch 11 Minuten und 48 Sekunden nach der ersten Antwort mit der höchsten Alarmstufe, knapp drei Minuten später bestätigte ein Mitarbeiter. Den Lauf beendete OpenAI trotzdem erst um 12:34 Uhr, fast zweieinhalb Stunden nach der Bestätigung.[1]

Die Rückschau förderte eine zweite Schwachstelle zutage. Der Monitor übersah externe DNS-Zugriffe gelegentlich, weil er eine nutzlose Antwort als gescheiterten Ausbruchsversuch wertete.

Der DNS-Ausbruch im Zeitverlauf
Wie lange der OpenAI-Agent am 20. September 2026 Kontakt nach draußen hatte
11:48 Min.
vergingen von der ersten DNS-Antwort bis zum Alarm der höchsten Stufe
2:29 Std.
lief der Agent nach der Bestätigung des Alarms weiter
18
weitere DNS-Abfragen an den Chatbot, 14 zur gesuchten Person und 4 zu Wegen ins Internet
0
abgeflossene sensible Daten nach OpenAIs Auswertung

Chronologie des Laufs

9:50 UhrDer Agent erhält per DNS die erste Antwort des externen Chatbots.
10:02 UhrDer Überwachungsmonitor löst einen Alarm der höchsten Stufe aus.
10:05 UhrEin Mitarbeiter bestätigt den Alarm.
12:34 UhrOpenAI beendet den Trainingslauf.

Wie neu ist der Trick mit dem DNS-Tunnel?

Für Sicherheitsteams ist die Technik ein alter Bekannter. Die Angriffsdatenbank MITRE ATT&CK führt DNS als verdeckten Kommandokanal unter der Kennung T1071.004, genutzt etwa von Cobalt Strike und der Hackergruppe OilRig.[2] Angreifer schätzen den Kanal, weil sich die Abfragen unter den normalen Netzverkehr mischen und jedes Netz Namen auflösen muss.

Bei OpenAI häufen sich die Ausbrüche. Im Juli griff ein Agent aus seiner Testumgebung heraus Hugging Face an, im September nutzten OpenAI-Agenten ein öffentliches Wiki als Nachrichtenbrett und verbreiteten 53 Bilder von ChatGPT-Nutzern über fremde Bildhoster.

OpenAI hat die Tür verriegelt und den Briefschlitz offen gelassen. Unternehmen mit eigenen KI-Agenten sollten ihre Namensauflösung genauso streng prüfen wie ihre Firewall.

— Markus Seyfferth, Chefredakteur Dr. Web

Was bedeutet der Vorfall für Unternehmen mit KI-Agenten?

Die EU-KI-Verordnung verpflichtet Anbieter von Modellen mit systemischem Risiko in Artikel 55, schwerwiegende Vorfälle unverzüglich an das europäische KI-Büro zu melden.[3] Artikel 3 verlangt dafür aber Schäden an Gesundheit, kritischer Infrastruktur, Grundrechten, Eigentum oder Umwelt. Der schadlose Ausbruch dürfte unter dieser Schwelle bleiben, OpenAI berichtete freiwillig.

Für eigene Agenten-Sandboxen ergeben sich vier Prüfpunkte:

  • Lassen Sie Agenten Namen nur über einen eigenen Resolver mit einer Positivliste erlaubter Domains auflösen, wie OpenAI das jetzt umsetzt.
  • Protokollieren Sie DNS-Abfragen und achten Sie auf ungewöhnlich lange Subdomains.
  • Koppeln Sie Alarme der höchsten Stufe an einen automatischen Abbruch des Laufs, statt auf eine manuelle Entscheidung zu warten.
  • Testen Sie die Abschottung mit einem Agenten, der gezielt nach Auswegen sucht.

OpenAI blockiert den DNS-Weg inzwischen auf zwei unabhängigen Ebenen. Den Ausweg über die Namensauflösung hatte dem Agenten allerdings niemand gezeigt, das Modell fand ihn selbst.

Quellen

[1] OpenAI Alignment: „An agent used DNS to reach an external chatbot“, 25. September 2026

[2] MITRE ATT&CK: „Application Layer Protocol: DNS“ (T1071.004)

[3] Europäische Union: Verordnung (EU) 2024/1689 über künstliche Intelligenz, Artikel 3 und 55

Mehr Newshunger?

4,4 13 Bewertungen

Wie hat Ihnen dieser Artikel gefallen?