Schleifen statt Schichten: Was hinter Astras „recurrent depth“ steckt

Wendeltreppe von oben fotografiert, als Sinnbild für wiederholte Durchläufe
Photo by Dan Freeman on Unsplash

Seit dem Start von GPT-6 Astra am 3. September kursiert ein Begriff, den vorher kaum jemand außerhalb der Forschung benutzt hat: recurrent depth, auf Deutsch etwa wiederkehrende Tiefe. Ein Bericht von The Information brachte ihn in Umlauf, Sicherheitsforscher reagierten alarmiert, und seitdem gilt die Technik vielen als das eigentliche Geheimnis hinter Astras Sprung. Nur: Die Technik selbst ist deutlich unspektakulärer als ihr Ruf — und der interessante Streit dreht sich um etwas ganz anderes.

Das Wichtigste in Kürze

  • „Looped Transformer“ heißt schlicht, dass ein Modell dieselben Schichten mehrfach durchläuft, statt sie einmal abzuarbeiten.
  • Das Modell wird dadurch rechenintensiver, aber nicht größer — es braucht nicht mehr Speicher, nur mehr Rechenzeit.
  • OpenAI hat für Astra nichts dergleichen bestätigt; die Zuschreibung stammt aus einem Bericht von The Information vom 2. September.
  • Sicherheitsforscher fürchten, dass das Modell dabei weniger nachvollziehbar denkt. Diese Sorge ist berechtigt, aber nicht spezifisch für diese Technik.
  • Ein offenes chinesisches Modell, Nanbeige 4.2, setzt das Verfahren bereits nachweisbar ein — dort lässt es sich nachlesen statt vermuten.

Was ein Looped Transformer tatsächlich macht

Ein Sprachmodell besteht aus gestapelten Schichten, die Text Stück für Stück weiterverarbeiten. Normalerweise gilt: mehr Schichten bedeuten ein größeres Modell, das mehr Speicher braucht und teurer zu betreiben ist. Ein Looped Transformer bricht mit dieser Rechnung. Er schickt die Daten mehrfach durch denselben Schichtstapel, statt neue Schichten anzuhängen.

Das offene Modell Nanbeige 4.2 zeigt das Prinzip an einem konkreten Beispiel: Es durchläuft einen Stapel von 22 Schichten zweimal und verhält sich dadurch näherungsweise wie ein Modell mit 44 Schichten — ohne dass die Gewichte ein zweites Mal gespeichert werden müssten. Der Preis dafür ist Rechenzeit, denn jeder Durchlauf kostet. Im technischen Bericht des Modells steht auch, warum es bei zwei Durchläufen blieb: Mehr Schleifen brachten kaum noch Gewinn, machten das Training aber deutlich langsamer und teurer.

Der KI-Erklärer Sebastian Raschka ordnet die Sache nüchtern ein. Die Idee, Schichten wiederzuverwenden, sei ein kleiner architektonischer Kniff, kein Durchbruch. Verwandte Ansätze gibt es seit Jahren, etwa die auf der NeurIPS vorgestellte Methode „Mixture-of-Recursions“, bei der ein gelernter Verteiler pro Wortbaustein entscheidet, ob dieser einen, zwei oder mehr Durchläufe bekommt. Leichte Stellen im Text sind schnell fertig, schwierige bekommen mehr Rechenzeit.

Pro: Rechenleistung dort, wo sie gebraucht wird

Der Reiz des Verfahrens liegt in der Ökonomie. Viele Denkaufgaben brauchen nicht mehr Wissen, sondern mehr Verarbeitungsschritte — ein Modell muss Zwischenergebnisse mehrfach umformen, nicht mehr Fakten kennen. Genau dafür ist wiederholtes Durchlaufen ein günstiger Hebel: Der Speicherbedarf bleibt gleich, die Denktiefe wächst.

Das erklärt auch, warum die Forschung dazu 2026 derart zugenommen hat. Arbeiten wie „Reasoning with Latent Thoughts“ zeigen, dass vergleichsweise kleine Modelle mit mehr Durchläufen bei mehrstufigen Aufgaben aufholen können. Für den Betrieb ist das attraktiv: Ein Anbieter kann pro Anfrage entscheiden, wie viel Rechenzeit sie wert ist, statt für jede Anfrage dasselbe große Modell zu starten. Wie stark solche Effizienzfragen den Markt inzwischen bestimmen, hat sich zuletzt gezeigt, als Google OpenAI im Preis deutlich unterbot.

Contra: Denken, das niemand mitlesen kann

Der Einwand der Sicherheitsforscher setzt an einer anderen Stelle an. Moderne Modelle machen einen Teil ihres Denkens sichtbar, indem sie Zwischenschritte als Text ausgeben — die sogenannte Gedankenkette. Diese Zwischenschritte sind heute eines der wichtigsten Werkzeuge, um zu prüfen, ob ein Modell auf dem richtigen Weg ist oder unbemerkt etwas anderes verfolgt. Verlagert ein Modell mehr Arbeit in interne Durchläufe, bleibt weniger davon lesbar.

Die Sorge ist ernst zu nehmen. Nur trifft sie nicht die Technik als solche. Auch Raschka weist darauf hin, dass zusätzliche Durchläufe für sich genommen keine Gedankenkette unterdrücken — sie fügen Rechenschritte hinzu, wie gewöhnliche Schichten es auch tun. Denselben Effekt bekäme man, indem man das Modell schlicht vergrößert. Wer weniger nachvollziehbares Denken beklagt, kritisiert also einen allgemeinen Trend, nicht eine bestimmte Bauweise. OpenAIs Chefwissenschaftler Jakub Pachocki hat selbst gesagt, dass unbeabsichtigte Schäden immer schwerer zu verhindern seien und dies der Fortschrittsbremse gleichkommen könnte.

Was gesichert ist und was nicht

Hier lohnt eine klare Trennung. Gesichert ist, dass es die Technik gibt, dass sie funktioniert und dass mindestens ein offenes Modell sie einsetzt. Nicht gesichert ist, dass Astra sie verwendet. OpenAI hat dazu nichts veröffentlicht; die Zuschreibung geht auf The Information zurück und wurde anschließend von Fortune, TechCrunch und anderen aufgegriffen. Auch die weitergehende Behauptung, das Verfahren verberge gezielt die Gedankenkette, steht auf wackligem Grund — möglicherweise beschreibt der ursprüngliche Bericht eine andere Technik. Wer mit Astra arbeitet, merkt die Umstellung ohnehin an anderer Stelle: Das Modell reagiert anders auf alte Prompts als seine Vorgänger.

Bemerkenswert ist daher weniger die Architektur als die Dynamik drumherum: Ein einzelner Bericht über ein nicht dokumentiertes Detail eines geschlossenen Modells erzeugt innerhalb weniger Tage eine ausgewachsene Sicherheitsdebatte. Das sagt mehr über den Zustand der Branche aus als über Schleifen in neuronalen Netzen.

Fazit

Wer verstehen will, was Astra besser macht, wird bei den Schleifen nicht fündig. Sie sind ein solider Ingenieurskniff, der Rechenleistung effizienter einsetzt, und ihre Wirkung ist in offenen Modellen nachprüfbar. Der eigentliche Konflikt liegt tiefer: Je mehr Denken in die internen Zustände eines Modells wandert, desto weniger lässt sich von außen prüfen. Diese Verschiebung läuft seit Jahren und wird durch jede Effizienzsteigerung verstärkt. Die ehrliche Antwort auf die Frage, wie viel bei Astra davon passiert, lautet derzeit: Das weiß außerhalb von OpenAI niemand.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen