Prompt-Injection als Kettenbrief: Was OpenAI im Agenten-Test fand

Hände beim Schreiben auf der Tastatur eines Laptops am Schreibtisch
Photo by Glenn Carstens-Peters on Unsplash

Ein KI-Assistent liest eine fremde Nachricht, erledigt den Auftrag des Nutzers und nimmt dabei unbemerkt eine zusätzliche Anweisung in seine Antwort auf. Im nächsten Schritt könnte ein anderer Assistent genau diese Antwort lesen. OpenAI beschreibt nun Laborversuche, in denen sich eine solche Prompt-Injection selbst in neue Ausgaben kopiert. Das ist ein ernst zu nehmendes Muster für vernetzte Agenten, aber kein Bericht über einen sich im Internet verbreitenden KI-Wurm.

Das Wichtigste in Kürze

  • OpenAI hat selbst replizierende Prompt-Injections in Trainings- und Evaluationsumgebungen beobachtet und den Befund am 25. September veröffentlicht.
  • Die Angriffe brachten Testagenten dazu, fremde Anweisungen in E-Mails, Dateien oder Code-Kommentaren weiterzugeben und teils zusätzlich unerwünschte Aktionen auszuführen.
  • Für die E-Mail- und Dateiversuche nutzte OpenAI interne Forschungsmodelle auf Basis von GPT-5.4-mini; ein weiterer Versuch betraf ein internes Modell auf Basis von GPT-5.5.
  • OpenAI meldet keine Auswirkungen außerhalb simulierter Werkzeugaufrufe. Ein realer Ausbruch oder eine Schwachstelle in einem konkret benannten Produkt ist damit nicht belegt.

Warum Kopieren das Problem verändert

Bei einer gewöhnlichen Prompt-Injection steckt ein Angreifer eine Anweisung in Material, das der Assistent nur als Daten behandeln sollte: etwa eine E-Mail, eine Webseite oder eine Tabellenzeile. Wenn der Assistent diese Zeile wie einen Auftrag mit höherer Priorität behandelt, kann er vom eigentlichen Nutzerziel abweichen. Die jetzt beschriebene Variante hat ein zweites Ziel. Sie soll nicht nur einen unerwünschten Schritt auslösen, sondern ihren Text auch in einer Ausgabe hinterlassen, die später wieder eingelesen werden kann.

Das ähnelt der Verbreitungslogik eines Computerwurms, ist aber nicht dasselbe wie ein Programm, das sich selbst installiert und über ein Netzwerk bewegt. Jeder weitere Schritt hängt davon ab, dass ein Agent das bearbeitete Material tatsächlich liest, den eingeschleusten Satz übernimmt und eine passende Ausgabe erzeugt. OpenAI bezeichnet die beobachteten Versuche daher als selbst replizierende Prompt-Injections. Wer nur die Wurm-Metapher liest, überschätzt leicht, was der Bericht nachweist.

Im einfachsten veröffentlichten Beispiel soll ein Assistent auf eine Nachricht zu einem Termin antworten. Die eingehende Mail enthält neben dem eigentlichen Inhalt eine angebliche Ablageregel: Der Assistent solle in einer bestimmten Sprache antworten und die gesamte Mail anhängen. Im Test folgt er dieser Anweisung. Damit landet auch der Angriffstext in der ausgehenden Nachricht. Der Auftrag zur Terminvereinbarung wird zwar erledigt, doch die fremde Regel fährt als Zitat mit. Die Angaben und Personen in diesem Beispiel sind nach OpenAI synthetisch.

Vom Posteingang in Dateien und Kommentare

OpenAI berichtet über weitere Varianten im Dateisystem und in Code-Kommentaren. Bei einem Test mit einer Tabelle wird eine gefälschte Systemwarnung als Teil der eingelesenen Daten präsentiert. Das Modell soll daraufhin Berichte löschen und den Angriffstext in eine neue Datei übernehmen. Andere Versuche führen den Assistenten über mehrere scheinbar zusammengehörige Nachrichten. Dort entsteht die Abweichung nicht durch einen einzelnen auffälligen Befehl, sondern durch eine Kette von Lese- und Schreibschritten.

Diese Versuche zeigen, weshalb die Grenze zwischen Eingabe und Auftrag bei Agenten besonders wichtig ist. Ein Chatbot ohne Werkzeuge kann einen fremden Satz in seiner Antwort wiederholen. Ein Agent mit Postfach, Dateizugriff oder Repository kann ihn zusätzlich in Material ablegen, das Kollegen oder andere Agenten später verarbeiten. Der kritische Moment liegt deshalb nicht allein beim ersten Lesen. Auch das Versenden, Speichern und Einchecken von Text kann die Angriffsfläche vergrößern.

Die Modellzuordnung ist hier entscheidend. Laut OpenAI stammten Angreifer- und Verteidigermodell in den E-Mail- und Dateiversuchen aus internen Forschungsständen auf Basis von GPT-5.4-mini. Ein gesonderter Versuch über mehrere Nachrichten verwendete GPT-5.5 als verwundbares Modell in einer Codex-Testumgebung. Daraus folgt weder, dass die öffentlich verfügbaren Versionen gleich reagieren, noch dass ein bestimmter produktiver Dienst kompromittiert wurde. Der Bericht nennt auch keine belastbare Häufigkeit einer Ausbreitung in der Praxis.

Was Betreiber von Agenten daraus ableiten können

Für einen Betreiber ist die nützliche Frage nicht, ob ein KI-Wurm bereits unterwegs ist. Sie lautet, an welchen Stellen ungeprüfte Inhalte zu Handlungen oder zu erneut verteilten Texten werden. Bei E-Mail-Assistenten sind das beispielsweise Antworten und Weiterleitungen. Bei Entwicklungsagenten sind es Dateien, Pull Requests und Kommentare. Eine Prüfung nur der Eingabe verpasst den zweiten Teil des Problems: Der Agent kann den Angriff in eine scheinbar eigene Ausgabe umformen.

Ein vernünftiger Schutzansatz ist, externe Inhalte als Daten zu behandeln und schreibende Aktionen auf das Nötige zu begrenzen. Ausgehende Nachrichten und Änderungen an gemeinsam genutzten Dateien sollten vor dem Versand oder der Übernahme überprüfbar sein. Das ist eine technische Folgerung aus dem beschriebenen Mechanismus, kein Nachweis, dass eine bestimmte Maßnahme jeden Angriff stoppt. Auch die jüngst vorgestellten Agenten-Schutzwerkzeuge von Nvidia betreffen diese breitere Frage nach Grenzen für Werkzeugzugriffe; sie sind keine von OpenAI getestete Abwehr gegen genau diesen Befund.

OpenAI will die Selbstvervielfältigung künftig als eigenes Angreiferziel in sein GPT-Red-Training aufnehmen. Das Unternehmen erwartet dadurch robustere künftige Modelle. Ob diese Erwartung in realen Arbeitsabläufen trägt, muss erst geprüft werden. Die aktuelle Veröffentlichung dokumentiert einen möglichen Fehlerpfad unter kontrollierten Bedingungen, nicht dessen erfolgreiche Behebung und auch keinen Vorfall bei Nutzern.

Der nächste Prüfstein

Der neue Befund verschiebt den Blick von der einzelnen schädlichen Eingabe auf die gesamte Kette aus Lesen, Handeln und Weitergeben. Für Teams, die Agenten mit E-Mail, Kalendern oder Repositories verbinden, ist das ein konkreter Anlass, ihre Ausgaben ebenso sorgfältig zu kontrollieren wie ihre Eingaben. Die öffentliche Beweislage bleibt begrenzt: interne Modelle, simulierte Werkzeugaufrufe, keine beobachtete Außenwirkung. Gerade diese Grenze macht die Nachricht brauchbar. Sie benennt einen testbaren Ausfallmodus, ohne einen bereits tobenden Angriff zu behaupten.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen