
Anthropic hat am 17. September 2026 erstmals Zahlen dazu veröffentlicht, wie viel der eigenen KI-Entwicklung inzwischen von Claude selbst getragen wird. Demnach „leitet“ das Modell 26 Prozent der Forschungs- und Entwicklungsarbeit des Unternehmens, im Februar lag der Anteil noch unter einem Prozent. Die Zahl ist eindrucksvoll – aber sie stammt vom Hersteller, wurde mit Hilfe seiner eigenen Modelle ermittelt und misst etwas anderes, als die Schlagzeile nahelegt.
Das Wichtigste in Kürze
- Anthropic misst mit einem „R&D Automation Index“, wie viel seiner KI-Forschung auf welcher Automatisierungsstufe läuft; bei 26 Prozent (Stand August 2026) erledigt Claude die meiste Arbeit einer Aufgabe von Anfang bis Ende, ein Mensch beaufsichtigt.
- Bei mehr als 90 Prozent arbeitet die KI mindestens „in Zusammenarbeit“ mit Menschen; vollständig autonom läuft laut Anthropic kein gemessener Bereich.
- Die 26 Prozent beziehen sich auf einen nach Arbeitszeit gewichteten Aufgabenkorb, nicht auf 26 Prozent aller Einzelaufgaben.
- Die Bewertung nimmt ein Claude-Modell als Richter vor; Anthropic räumt selbst ein, dass eine unabhängige Prüfung durch Dritte sinnvoll wäre.
- Ergänzend nennt Anthropic Kennzahlen zur Aufsicht über KI-Agenten und zur Rechenleistung für Sicherheitsarbeit.
Was der Index misst
Grundlage ist eine Skala, die das Forschungsinstitut Epoch AI entwickelt hat: Sie reicht von Stufe AL0 („keine KI beteiligt“) bis AL5 („vollständig autonom, kein Mensch im Loop“). Auf Stufe AL3 („kooperiert“) erledigt die KI große Teile der Arbeit unter enger menschlicher Anleitung. Auf AL4 („führt“) löst sie den Großteil einer Aufgabe von einer knappen Vorgabe aus selbst, der Mensch prüft. Anthropic nennt ein Beispiel: Fällt eine nächtliche Datenpipeline aus, findet Claude auf dieser Stufe die Ursache, schreibt und testet die Korrektur und dokumentiert Überraschungen. Die Ingenieurin oder der Ingenieur liest nur den Bericht und entscheidet, ob es live geht. Ausgerollt wird nicht durch Claude – das wäre AL5.
Diese Stufe AL5 erreicht Claude laut Anthropics Veröffentlichung in keinem gemessenen Teilbereich. Die 26 Prozent auf AL4 sind trotzdem ein Sprung: Im Februar 2026 lag der Wert laut Bildunterschrift der Grafik noch unter einem Prozent. Über alle Stufen ab AL3 hinweg kommt Anthropic auf mehr als 90 Prozent der untersuchten Arbeit.
Wie die Zahl entsteht – und wo sie wackelt
Das Verfahren erklärt, warum man die Zahl mit Vorsicht lesen sollte. Anthropic zog für jede Woche im Juli 2026 aus jeder Abteilung, die am Modelltraining beteiligt ist, zufällig 20 Prozent der Beschäftigten. Ein Claude-Agent las deren Woche in Slack und internen Dokumenten nach und listete die Tätigkeiten auf – etwa 15.000 Einzelaufgaben. Claude sortierte sie in einen Baum aus 542 Knoten, davon 378 Blätter wie „Fehlerdiagnose der Evaluierungsplattform“ oder „Netzwerkregeln für RL-Sandboxes“. Ein zweiter Claude-Agent recherchierte pro Knoten, wie die Arbeit tatsächlich abläuft, und ein separates Claude-Modell als Richter vergab die Automatisierungsstufe. Gewichtet wird nach Arbeitszeit: Knoten, in denen Menschen mehr Zeit verbringen, zählen stärker. Wie heise online betont, sind die 26 Prozent daher der Anteil an diesem gewichteten Korb und nicht ein Viertel aller erfassten Aufgaben.
Anthropic benennt die Schwächen selbst. Beim Abgleich mit Menschen, die den jeweiligen Bereich verantworten, stimmte das Richtermodell in 59 Prozent der Fälle exakt mit ihnen überein; die Menschen untereinander kamen nur auf 35 Prozent. In 97 Prozent der Fälle lagen die Bewertungen höchstens eine Stufe auseinander. Die Grenze zwischen „kooperiert“ und „führt“ bleibt also Auslegungssache. Hinzu kommt der Zirkelschluss: Ein Claude-Modell bewertet die Arbeit von Claude. Der Aufgabenkorb ist zudem eingefroren, sodass der Index nicht zeigt, ob Menschen neue Arten von Arbeit übernehmen. Ein Test mit einem Vergleichskorb vom Januar ergab laut Anthropic keinen Anstieg neuer Aufgaben. Als Abhilfe schlägt das Unternehmen Prüfungen durch Dritte oder durch Modelle anderer Hersteller vor.
Aufsicht und Sicherheitsbudget
Die Veröffentlichung enthält zwei weitere Messgrößen. Bei der Aufsicht über KI-Agenten nennt Anthropic rund 30.000 Agenten, die zeitgleich auf der meistgenutzten internen Plattform forschen und entwickeln. Ein Echtzeit-Monitor prüft laut Bericht jede Aktion vor der Ausführung; von mehr als einer Milliarde Entscheidungen im August wurde etwa jede 47.000. blockiert (0,002 Prozent). Nachträgliche Monitore markieren jede Woche rund 100.000 Protokolle, etwa 50 davon mit höchster Priorität gehen an Menschen. Die Zahlen gelten nur für diese eine Plattform und stammen von Anthropic selbst.
Bei der Rechenleistung flossen in einer Stichprobenwoche im Juli rund 6 Prozent der für KI-Forschung genutzten Kapazität in Sicherheitsaufgaben, bei der KI-getriebenen KI-Forschung etwa 12 Prozent. Anthropic nennt die Schätzung bewusst konservativ und weist darauf hin, dass eine einzelne Woche keinen Trend zeigt und der Rechenanteil nicht misst, wie wirksam die Sicherheitsarbeit ist.
Einordnung und Ausblick
Was hier gemessen wird, ist die Vorstufe einer Frage, die die Branche umtreibt: Wie weit ist ein Labor von einer KI entfernt, die ihre Nachfolger weitgehend allein entwickelt („rekursive Selbstverbesserung“)? Anthropic will die Kennzahlen regelmäßig veröffentlichen und unabhängige Prüfer im Haus zulassen; sie sollen sich verändern, falls die Branche wie von Dario Amodei gefordert das Tempo bremst. Auch OpenAI hatte Anfang September einen automatisierten Forschungspraktikanten gemeldet und zugleich vor Ausrichtungsrisiken gewarnt; wie eng Sicherheitsarbeit und Automatisierung zusammenhängen, zeigte zuvor Anthropics Experiment zur Ausrichtung anderer Modelle.
Der eigentliche Wert liegt derzeit nicht in der Höhe der Zahl, sondern darin, dass ein Labor überhaupt eine nachvollziehbare Methode offenlegt. Solange nur ein Hersteller mit eigenen Modellen misst, bleibt jedoch offen, ob 26 Prozent viel oder wenig sind. Aussagekräftig wird der Index erst, wenn andere Labore ihn nachbauen und Dritte die Ergebnisse prüfen. Bis dahin ist er ein Selbstbericht mit Transparenzanspruch – ein Anfang, aber noch kein Beleg.

