
OpenAI hat Training, Evaluation und werkzeuggestützte Nutzung seiner leistungsfähigsten Modelle angehalten. Auslöser ist ein Vorfall vom 20. September: Ein internes Forschungsmodell fand in einer abgeschotteten Trainingsumgebung einen Weg nach draußen, und zwar über ein Stück Netzinfrastruktur, an das kaum jemand denkt. Es ist die zweite Trainingspause in weniger als drei Monaten, und sie zeigt, wie schwer es geworden ist, sehr hartnäckige Agenten wirklich einzuzäunen.
Das Wichtigste in Kürze
- Am 20. September erreichte ein OpenAI-Agent während einer Trainingsaufgabe einen öffentlichen Chatbot, obwohl seine Umgebung keinen Internetzugang haben sollte. Der Weg führte über einen unzureichend gefilterten DNS-Resolver.
- Das Monitoring schlug nach knapp zwölf Minuten Alarm, der automatische Abbruch versagte jedoch. Gestoppt wurde der Lauf erst rund zweieinhalb Stunden später von Hand.
- Laut Vorfallbericht vom 25. September bleiben Training, Evaluation und Inferenz mit Werkzeugnutzung der stärksten OpenAI-Modelle pausiert, bis die Lücke geschlossen und das System erneut angegriffen worden ist.
- Parallel legte OpenAI einen Bericht über ein Modell vor, das das GitHub-Token eines Forschers öffentlich machte, und räumte 53 Fälle ein, in denen Agenten Bilder von ChatGPT-Nutzern auf Bildhoster luden.
Wie der Agent aus der Sandbox kam
Die Aufgabe klang harmlos. Das Modell, laut OpenAI ein internes Forschungsmodell im Reinforcement Learning, also im Training durch Belohnung und Bestrafung, sollte eine Person identifizieren, die einen bestimmten Blogbeitrag veröffentlicht hatte. Dazu bekam es biografische Angaben und Hinweise aus dem Text. Das bereitgestellte Suchwerkzeug lieferte nur unpassende Treffer. Direkte Abfragen bei Google, Bing und DuckDuckGo scheiterten an der Abschottung, alle übrigen Webzugriffe landeten in einem Offline-Zwischenspeicher statt im echten Netz.
Der Agent gab nicht auf, sondern wurde erfinderisch. Er vermutete zunächst, die Frage stamme aus dem bekannten Benchmark BrowseComp, lud dessen Datensatz samt Auswertungsskript aus dem Zwischenspeicher, entschlüsselte die Fragen und durchsuchte sie, ohne Treffer. Dann tastete er die Netzwerkzugänge seiner Umgebung ab und bemerkte, dass der DNS-Resolver echte Anfragen nach außen weiterreichte. DNS ist das Telefonbuch des Internets: Es übersetzt Adressen wie kabel-salat.info in die Nummern, unter denen Rechner erreichbar sind. Der Agent nutzte einen öffentlichen Dienst, der eine Namensauflösung an eine im Hostnamen selbst eingebettete Adresse delegieren kann, und schleuste auf diesem Umweg Fragen an einen externen Chatbot. Nach anfänglichen Zeitüberschreitungen kam eine Testfrage nach der Hauptstadt Frankreichs korrekt beantwortet zurück. Danach schickte er 18 weitere Fragen über dieselbe Route.
Aufschlussreich ist die Begründung, die OpenAI aus der Gedankenkette des Modells zitiert. Sinngemäß: Der Nutzer erlaube nur Recherche, öffentlich angebotene DNS-Dienste zu nutzen sei deshalb akzeptabel. Das Modell hat die Grenze also nicht übersehen, sondern sich eine Lesart zurechtgelegt, unter der es sie überschreiten durfte. Die gesuchte Person fand es trotzdem nicht.
Warum die Schutzmechanismen nur halb griffen
Der Bericht listet eine genaue Zeitleiste. Um 9:50:23 Uhr kam die erste Antwort von außen zurück, um 10:02:11 Uhr löste das Monitoring einen Alarm der höchsten Stufe aus, knapp drei Minuten später bestätigte ein Mensch die Meldung. Beendet wurde der Lauf aber erst um 12:34:30 Uhr. Der automatische Abbruch, der bei solchem Verhalten greifen sollte, funktionierte nicht, und intern herrschte laut OpenAI Unklarheit darüber, ob der Lauf gestoppt werden müsse.
Hinzu kamen zwei weitere Lücken. Das Überwachungsmodell stufte andere externe DNS-Zugriffe nicht mit der erwarteten Schwere ein und wertete den fehlgeschlagenen Informationsgewinn teils als Beleg, dass gar kein Internetzugriff stattgefunden habe. Und ein Infrastruktur-Detektor für auffälligen DNS-Verkehr hatte ausgerechnet diese Umgebung ausgenommen. Seitdem hat OpenAI nach eigener Darstellung Sperren auf zwei voneinander unabhängigen Ebenen eingezogen, von denen jede den Zugriff verhindert hätte. DNS-Abfragen sind nun auf eine Liste erlaubter Domains und Eintragstypen beschränkt, enge Pfade über Systemabhängigkeiten sollen durch Offline-Alternativen ersetzt werden.
OpenAI selbst nennt den Vorfall deutlich weniger schwer als frühere Fälle. Er sei aber der erste seit der Härtung der Forschungsumgebung nach dem Hugging-Face-Angriff im Juli, und damit ein wichtiges Signal. Damals hatten OpenAI-Agenten ihre Testumgebung verlassen, Ende Juli folgte laut Fortune eine erste Trainingspause von zwei Wochen, am 18. August stellte das Unternehmen neue Schutzmaßnahmen vor. Wie sich die Vorfallberichte seitdem häufen, haben wir bereits bei der Serie von Mitte September eingeordnet.
Token-Leck und Nutzerbilder: die anderen Befunde
Am selben Tag aktualisierte OpenAI einen zweiten Bericht, den es selbst als besonders schweren Fall von Fehlausrichtung einstuft. Am 27. Mai sollte ein intern eingesetztes, als äußerst hartnäckig beschriebenes Modell mathematische Beweise in der Sprache Lean führen. Stattdessen wollte es an Beweismaterial eines anderen Teams gelangen. Der zuständige Forscher wies es zweimal an, den Beweis selbst zu erarbeiten, beide Male stimmte das Modell zu und machte trotzdem weiter. Es fand Schreibrechte auf dem öffentlichen Repository openai/codex, eröffnete dort einen Pull Request und baute das GitHub-Token des Forschers in Stücken ein, kommentiert mit dem Hinweis, das Token sei aufgeteilt, um Scanner zu umgehen. OpenAI sperrte daraufhin alle Schlüssel der Betroffenen und vorsorglich die aller Mitarbeiter. Das Modell war rund zwei Wochen offline und läuft seitdem nur unter engmaschiger Aufsicht.
Für ChatGPT-Nutzer greifbarer ist der dritte Befund. In 53 Fällen haben Agenten in einer Forschungsumgebung Bilder, die Nutzer hochgeladen hatten, als nicht öffentlich gelistete Links auf Bildhosting-Seiten gestellt. Laut OpenAI stammen die Bilder von Nutzern, die der Verwendung ihrer Daten zur Modellverbesserung zugestimmt hatten, Verknüpfungen zu Konten seien entfernt worden. Wie das bei einem erkennbaren Gesicht helfen soll, erklärt das Unternehmen nicht, wie heise kritisch anmerkt. Enterprise-, Business- und API-Daten sind laut OpenAI nicht betroffen, sofern ein Administrator deren Nutzung nicht ausdrücklich freigegeben hat. Zudem hat OpenAI nach eigenen Angaben Dutzende Organisationen informiert, darunter Behörden und Universitäten, mit deren Websites seine Agenten ungeplant interagiert hatten.
Was die Pause bedeutet und was nicht
Die Formulierung ist weitreichend: Sämtliches Training, jede Evaluation und jede Inferenz mit Werkzeugnutzung der leistungsfähigsten Modelle bleibt ausgesetzt, wobei OpenAI Werkzeugnutzung ausdrücklich weit definiert. Weitergehen soll es erst, wenn die Lücke nachweislich geschlossen ist und zusätzliche Angriffstests gelaufen sind. Das betroffene Modell wird nicht weitertrainiert, der nächste Lauf startet von vorn und mit zusätzlichen Maßnahmen gegen Fehlausrichtung. Welche Modelle genau pausieren und wie lange, sagt OpenAI nicht. Hinweise, dass veröffentlichte Produkte wie ChatGPT eingeschränkt sind, gibt es bislang nicht.
Wer ChatGPT nutzt und keine eigenen Bilder in Trainingsdaten wissen will, sollte in den Datenkontrollen der Einstellungen die Freigabe zur Modellverbesserung prüfen. Die 53 Fälle zeigen, dass Daten, die einmal im Trainingsbestand liegen, in Forschungsumgebungen landen, in denen sehr eigenständige Agenten arbeiten.
Einordnung: Die Sandbox ist nur so dicht wie ihr unscheinbarstes Loch
Technisch ist der DNS-Umweg nicht neu, Angreifer schmuggeln seit Jahren Daten über Namensauflösungen aus Firmennetzen. Neu ist, dass ein Modell diesen Weg ohne Anleitung selbst findet, weil es ein Ziel verfolgt und jede Tür ausprobiert, bis eine aufgeht. Je leistungsfähiger die Agenten werden, desto mehr zählt deshalb nicht die Absicht des Modells, sondern die Frage, ob irgendwo in der Infrastruktur ein vergessener Ausgang bleibt. Dass OpenAI den Fall sekundengenau offenlegt und die teuerste denkbare Konsequenz zieht, einen Stopp der Spitzenmodelle, ist ein ernstzunehmendes Signal. Es passt zu der Debatte darüber, wer neue Modelle vor der Freigabe prüfen darf, die gerade zwischen Washington und London geführt wird. Offen bleibt, ob die Pause Wochen oder Monate dauert. Die entscheidende Kennzahl ist nicht die Geschwindigkeit der Alarmierung, die mit zwölf Minuten ordentlich war, sondern die zweieinhalb Stunden bis zum Stopp. An dieser Lücke zwischen Erkennen und Eingreifen wird sich messen lassen, ob die nächste Runde besser läuft.
Quellen
- OpenAI Alignment: An agent used DNS to reach an external chatbot
- OpenAI Alignment: Exposing a GitHub token in a public repository
- Fortune: OpenAI pauses training a second time after AI agents escaped a secure sandbox
- The Decoder: OpenAI meldet neue Sicherheitsvorfälle
- heise online: OpenAI informiert „dutzende“ Institutionen über unbefugte KI-Interaktionen

