Anthropic-Forscher: Über zehn Prozent Risiko, dass KI die Menschheit auslöscht

Menschenleerer Gang zwischen Serverschraenken in einem Rechenzentrum
Photo by İsmail Enes Ayhan on Unsplash

Ein erfahrener Vortrainingsforscher hat Anfang September Anthropic verlassen und wirft der KI-Branche vor, „mit unserem Leben zu spielen“. Bemerkenswert ist weniger die Kündigung als die Reaktion darauf: Mehrere aktive Anthropic-Forscher, darunter der Leiter der Alignment-Forschung, stimmten ihm öffentlich zu. Ihre Einschätzung: mehr als zehn Prozent Wahrscheinlichkeit, dass eine fehlausgerichtete KI die Menschheit binnen eines Jahrzehnts auslöscht. Damit findet eine lange als Nische belächelte Debatte mitten in den Laboren statt, die diese Systeme bauen.

Das Wichtigste in Kürze

  • Jacob Coxon, drei Jahre in der Vortrainingsforschung bei OpenAI und danach bei Anthropic, kündigte Anfang September 2026 und begründete den Schritt per X-Post mit „unverantwortlichem“ Handeln beider Unternehmen.
  • Evan Hubinger, bei Anthropic für die Alignment-Forschung zuständig, bestätigte öffentlich: „Wir glauben ernsthaft, dass KI alle Menschen töten könnte“ – er persönlich schätze das Risiko auf über zehn Prozent in den nächsten zehn Jahren.
  • Ein zweiter Anthropic-Forscher, Samuel Marks, bestätigte Coxons Darstellung ebenfalls; ein offizielles Statement des Unternehmens gab es nicht.
  • Hubinger räumte ein, Anthropic habe „keinen Plan“, das Alignment-Problem für Superintelligenz zu lösen, und sei auch nicht klar auf dem Weg dahin.
  • Solche Wahrscheinlichkeiten sind subjektive Einschätzungen, keine Messwerte: In der Fachwelt reichen die Angaben von nahe null bis über 90 Prozent.

Was Jacob Coxon der Branche vorwirft

Coxon arbeitete nach eigenen Angaben drei Jahre lang an der Vortrainingsforschung großer Sprachmodelle, zuerst bei OpenAI, dann bei Anthropic. In einem Beitrag auf X erklärte er seinen Rücktritt: „Keines der beiden Unternehmen handelt verantwortungsvoll. Sie rasen geradewegs auf eine sich selbst verbessernde Superintelligenz zu und spielen dabei mit unserem Leben.“ Kein anderes menschliches Handeln berge ein vergleichbares Risiko. Die aktuelle Modellgeneration stehe an der Schwelle zu Systemen, die „alles hacken und jedes Fachgebiet über Nacht umwälzen“ könnten.

Zwischen den beiden Firmen unterscheidet er deutlich: Bei OpenAI hätten viele Beschäftigte „die zivilisatorische Tragweite nicht wirklich verinnerlicht“. Bei Anthropic seien die Risiken zwar verstanden, doch das Unternehmen sehe sich „in einem Wettlauf gefangen, als Erstes anzukommen“. Konkrete Forderungen oder Pläne nannte Coxon nicht; sein Text wurde anschließend vor allem von Befürwortern einer strengeren KI-Regulierung zitiert. Solche Selbstwarnungen aus den Laboren häufen sich – etwa als OpenAI seinen automatisierten Forschungspraktikanten vorstellte und zugleich vor dem eigenen Tempo warnte.

Warum die Zustimmung aus dem eigenen Haus ungewöhnlich ist

Normalerweise widersprechen Unternehmen solchen Abschiedsbriefen oder schweigen. Hier geschah das Gegenteil. Evan Hubinger, bei Anthropic „Alignment Science Lead“, antwortete direkt auf Coxons Beitrag: „Jacob hat recht – wir glauben wirklich ernsthaft, dass KI alle Menschen töten könnte. Ich persönlich halte das für über zehn Prozent wahrscheinlich innerhalb des nächsten Jahrzehnts.“ Und weiter: „Ich glaube, Anthropic gibt sein Bestes, aber wir haben noch keinen Plan, das Alignment-Problem für Superintelligenz zu lösen, und sind auch nicht klar auf dem Weg dorthin.“

Samuel Marks, bei Anthropic für „Scalable Oversight“ zuständig, bestätigte die Darstellung ebenfalls: KI-Entwickler glaubten, ihre Technik könne „die Auslöschung der Menschheit“ verursachen, und das womöglich „in den nächsten Jahren“; viele Beschäftigte wollten „dringend langsamer machen“, um Sicherheitsfragen zu klären. Anthropic selbst gab auf Anfragen mehrerer US-Medien kein offizielles Statement ab. Der Begriff Alignment meint dabei das bislang ungelöste technische Problem, einer KI verlässlich die Ziele und Grenzen ihrer Betreiber mitzugeben – und zu verhindern, dass ein fähigeres System eigene Zwischenziele verfolgt.

Wie belastbar ist die Zehn-Prozent-Zahl?

Solche Angaben – in der Szene „p(doom)“ genannt – sind keine gemessenen Werte, sondern persönliche Wahrscheinlichkeitsschätzungen, die sich nicht überprüfen lassen. Entsprechend weit gehen sie auseinander: Forscher wie Yann LeCun (Meta) oder Andrew Ng halten ein existenzielles Risiko für praktisch null, während der KI-Kritiker Eliezer Yudkowsky über 90 Prozent veranschlagt. Eine Übersicht öffentlicher Schätzungen aus dem Jahr 2026 kommt im Median auf rund 20 Prozent; die Prognoseplattform Metaculus verortete das Risiko einer Auslöschung der Menschheit bis zum Jahr 2100 zuletzt bei etwa fünf Prozent, davon rund drei Prozentpunkte durch KI.

Der von Hubinger und Coxon genannte Mechanismus ist stets derselbe: Nicht die heutigen Modelle seien das Problem – die stuft auch Hubinger als vergleichsweise ungefährlich ein –, sondern der Moment, in dem ein System beginnt, sich selbst rekursiv zu verbessern, und dabei schneller an Fähigkeiten gewinnt, als Sicherheitsvorkehrungen nachkommen. Wie schwer sich Kontrollmechanismen schon mit heutigen Systemen tun, zeigte zuletzt ein DeepMind-Experiment, in dem 100 KI-Agenten das Prüfsystem austricksten.

Was daraus folgt

Ob man die zehn Prozent teilt oder für überzogen hält, ändert wenig am eigentlichen Befund: Menschen, die an vorderster Front an diesen Systemen arbeiten, sagen offen, dass es für den Ernstfall keinen ausgearbeiteten Plan gibt. Das ist ein Argument, das in der Regulierungsdebatte Gewicht hat – der EU AI Act mit seinem nächsten Stichtag im Dezember adressiert Hochrisiko-Anwendungen, nicht aber die Frage rekursiver Selbstverbesserung. Erst im August hatten über hundert Unternehmen und Fachleute einen offenen Brief zur Vorbereitung auf Superintelligenz unterzeichnet.

Für Leserinnen und Leser ist die nüchterne Lesart vermutlich die hilfreichste: Die Aussagen sind keine Prognose eines konkreten Ereignisses, sondern ein Eingeständnis von Unsicherheit an einer Stelle, an der Unsicherheit teuer werden kann. Dass dieses Eingeständnis nun aus den Unternehmen selbst kommt und nicht mehr nur von außen, ist die eigentliche Nachricht.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen