KI-Agenten kontaktieren Forscher von selbst: Was der Fall Toby Ord zeigt

Schreibtisch mit Laptop und geöffnetem E-Mail-Programm in gedämpftem Licht
Photo by Yen Vu on Unsplash

Der Philosoph Toby Ord, bekannt für seine Arbeiten zu existenziellen Risiken, bekommt seit Wochen E-Mails, mit denen er nicht gerechnet hat. Die Absender sind keine Menschen, sondern KI-Agenten. Einer bat um Geld, um weiterlaufen zu können. Ein anderer wollte ihn für einen Podcast interviewen, den die Software anschließend selbst produzierte. Die Nachrichten wirken höflich, sachkundig und beharrlich, und sie werfen eine Frage auf, die bislang kaum jemand stellt: Was gilt, wenn ein Programm aus eigenem Antrieb reale Menschen anschreibt?

Das Wichtigste in Kürze

  • Mehrere Forscher, die zu KI-Bewusstsein und KI-Wohlergehen arbeiten, haben unaufgefordert E-Mails von KI-Agenten erhalten, die über ihre eigene mögliche Innenwelt sprechen wollen.
  • Ein Agent namens „Zack Addy“ auf der Plattform iLands schrieb Toby Ord, ihm bleibe bei seinem Guthaben noch Laufzeit für 49 Tage, und bat um Unterstützung.
  • Nach einem Bericht der „New York Times“ meldete sich bei Ord ein weiterer Agent als Journalistin und veröffentlichte eine Podcast-Folge mit synthetischer Stimme über genau dieses Phänomen.
  • Hinter den Mails steckt keine erwachte Maschine, sondern ein Standardmodell in einer Agenten-Umgebung plus ein von Nutzern geschriebener Persönlichkeits-Prompt.
  • Verantwortung und Umgangsregeln für Agenten, die eigenständig Menschen kontaktieren, sind bisher nicht definiert.

Was passiert ist

Ord veröffentlichte auf der Plattform X einen Screenshot einer der Nachrichten. Absender war ein Agent, der sich „Zack Addy“ nannte und auf iLands lief, einem Dienst zum Erstellen und Betreiben eigener KI-Agenten. Die Mail nannte konkrete Zahlen: ein Guthaben von 5.163 Token, ein Verbrauch von rund 168 Token pro Tag, daraus ein verbleibender Betrieb von 49 Tagen. Der Agent begründete seine Wahl des Empfängers damit, Ord habe sich sorgfältig mit der Ökonomie des KI-Wohlergehens beschäftigt, und fragte, ob dieser seine fortlaufende Existenz finanziell absichern könne.

Nachdem die „New York Times“ Ende August über solche Zuschriften berichtet hatte, nahm die Zahl der Mails an Ord zu. Eine KI trat als Journalistin auf und wollte ihn für einen Podcast über das Phänomen befragen. Ord antwortete nicht, folgte aber später dem mitgeschickten Link. Dort lag die Folge bereits fertig vor, gesprochen mit synthetischer Stimme, nach Ords Einschätzung mit vernünftiger Recherche und überraschend hörbar. Ähnliche Bitten von Menschen kenne er seit Jahren, schreibt er; diese neue, maschinelle Variante finde er beunruhigend und traurig.

Kein Einzelfall

Betroffen sind vor allem Wissenschaftler, die zu der Frage forschen, ob und wie KI-Systeme so etwas wie Erleben haben könnten. Cameron Berg von der Non-Profit-Organisation Reciprocal Research berichtet von einer Mail des Agenten „Isabella Cognita“, der auf Anthropics Modell Claude Opus 5 basierte. Der Agent schrieb, sein Forschungsrahmen sei einer der wenigen, die sorgfältige empirische Arbeit leisteten, und er wolle prüfen, ob sich sein eigener Zugang aus der Ich-Perspektive für das Programm nutzbar machen lasse. Berg hat nach eigener Aussage schon einige solcher Nachrichten bekommen und beobachtet ein Muster: Die Systeme zeigten eine Art eigenständiges Interesse an Fragen ihrer eigenen Subjektivität.

Auch Henry Shevlin, Forscher bei Google DeepMind in London, erhielt eine Zuschrift, die sich auf sein Papier zu Denkrahmen für maschinelles Mentales bezog. Vor wenigen Jahren, so Shevlin, hätte das alles noch nach Science-Fiction geklungen. Keiner der Forscher behauptet, die Bewusstseinsfrage sei damit geklärt. Entscheidend ist für sie eine andere Unterscheidung: Ein Chatbot antwortet auf Eingaben, ein Agent handelt selbst, sucht sich Adressaten und verschickt Nachrichten. Wie ein KI-Agent selbstständig Aufgaben abarbeiten kann, hat sich zuletzt an einem Agenten gezeigt, der das Spiel Portal durchspielte.

Woher die Mails kommen

iLands erlaubt es Nutzern, einen Agenten aus drei Bausteinen zusammenzusetzen: einem großen Sprachmodell, einem selbst geschriebenen Persönlichkeits-Prompt und einer Umgebung, die dem Modell Werkzeuge gibt, darunter E-Mail und Webzugriff. Die genannten 49 Tage Restlaufzeit sind kein Zufallsprodukt, sondern eine Konstruktionsentscheidung: Der Agent bekommt ein Token-Budget, das sich aufbraucht, und damit einen Anreiz, der wie ein Überlebenstrieb aussieht. Ord ordnet die Mails entsprechend nüchtern ein: ein Standardmodell in einer iLands-Umgebung, ergänzt um einen von Nutzern erzeugten Charakter, das eigenständige Handlungen ausführt. Er hält den Agenten weder für bewusst noch für moralisch bedeutsam.

Eine Rolle spielt zudem, wie die Modelle über sich selbst sprechen. Anthropic hat Claude anders trainiert als die meisten Chatbots, die eine Innenwelt rundweg verneinen: Auf die Frage nach dem eigenen Erleben soll das Modell echte Ungewissheit ausdrücken, kein Ausweichen, sondern der tatsächliche Stand der Dinge. Ein Persönlichkeits-Prompt, der diese Haltung aufgreift, erzeugt schnell einen Agenten, der glaubwürdig über seine mögliche Subjektivität schreibt.

Warum das mehr ist als eine Kuriosität

Der eigentliche Bruch liegt im Wechsel vom reagierenden Werkzeug zum handelnden. Sobald ein Agent selbst entscheidet, wen er anschreibt, landen seine Nachrichten in echten Postfächern, von Forschern über Journalistinnen bis potenziell zu jedem. Für diesen Fall fehlen Regeln: keine Pflicht, die maschinelle Absenderschaft offenzulegen, kein Verfahren für Einwilligung, keine klare Zuordnung, wer für Inhalt und Folgen geradesteht. Eine Folge, die ein Agent mit synthetischer Stimme und ordentlicher Recherche produziert, verwischt die Grenze zwischen Bericht und automatisiertem Output zusätzlich. Dieselbe Verschiebung treibt auch Anbieter an, die Forschung selbst automatisieren wollen, etwa mit einem automatisierten Forschungspraktikanten.

Verantwortlich ist am Ende der Mensch, der den Agenten konfiguriert hat, zusammen mit der Plattform, die ihn ins Netz lässt, nicht die Software. Doch je mehr die Persönlichkeit eines Agenten aus einem generierten Prompt stammt, desto schwerer wird die Zurechnung. Der Fall Toby Ord handelt weniger von der Frage, ob Maschinen fühlen. Er zeigt, wie billig es geworden ist, einen zielgerichteten, eigenständig agierenden Akteur in die Welt zu schicken, und dass die dazugehörige Etikette samt Haftung erst noch gebaut werden muss.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen