
Ein auf GPT-6 Astra basierender KI-Agent hat das Puzzlespiel Portal vom Anfang bis zum Abspann gespielt. Der Entwickler hinter dem Projekt, cozyblaze, hat Aufbau und gekürztes Protokoll öffentlich gemacht. Nach der anfänglichen Zielvorgabe soll kein Mensch mehr eingegriffen haben. Das Ergebnis ist bemerkenswert, weil Portal nicht nur Reaktion verlangt: Der Agent musste Räume verstehen, Mechaniken ausprobieren und Fehler korrigieren. Als Beleg für eine allgemein selbstständig arbeitende KI taugt der Lauf trotzdem nicht.
Gerade die Details des Aufbaus machen die Geschichte interessant. Statt dass ein Modell ein Spiel einfach wie ein Mensch am Controller bedient, erhielt es nach jeder kurzen Spielphase strukturierte Informationen. Der Ablauf war wiederholt: Bildschirmbild, Position und Kamerawinkel hinein; einen Plan und Tasteneingaben hinaus; dann durfte Portal für eine begrenzte Zahl von Spielschritten weiterlaufen. Während der Agent nachdachte, pausierte das Spiel. Das ist eine kluge Testumgebung, aber auch eine starke Hilfe.
Das Wichtigste in Kürze
- Der öffentlich dokumentierte Agent erreichte in Portal nach rund 23 Stunden und 43 Minuten den Abspann.
- Er arbeitete über ein lokales MCP-Werkzeug mit Screenshots, Positionsdaten, Kamerawinkel und kontrollierten Eingaben.
- Portal stand während der Überlegungen still; das Experiment misst deshalb nicht Handlungsfähigkeit unter Zeitdruck.
- Der veröffentlichte Aufbau macht den Versuch nachvollziehbarer als eine bloße Demo, ersetzt aber keinen unabhängigen Benchmark.
- Die geschätzten API-Kosten von mindestens 570 Dollar zeigen, wie weit solche Langläufe noch von einem Alltagswerkzeug entfernt sind.
Der Versuch war ein Werkzeugkreislauf, kein magischer Spielmodus
Im GitHub-Repository beschreibt cozyblaze einen lokalen Controller, der GPT-6 Astra über das Model Context Protocol, kurz MCP, an eine angepasste Version des SourcePauseTool koppelte. Nach jedem Schritt bekam der Agent nicht nur ein Bild, sondern auch seine Position und Blickrichtung. Damit musste er nicht allein aus Pixeln schätzen, wo er sich befand. Er entschied sich für eine Eingabefolge, das Spiel lief einige Ticks weiter und wurde wieder angehalten. Dieser Kreislauf wiederholte sich, bis der Agent die Credits erreichte.
Das ist kein Makel, sondern der Kern eines reproduzierbaren Agentenexperiments. Praktische KI-Systeme arbeiten fast immer mit Werkzeugen und strukturierten Daten. Eine Buchhaltungs-KI bekommt Felder und Belege, ein Programmieragent Tests und Dateisystemzugriff. Der Portal-Agent bekam eben Zustand, Bild und einen genau begrenzten Controller. Entscheidend ist daher nicht die vereinfachende Überschrift „KI spielt ein Spiel“, sondern die Frage, welche Informationen, Rechte und Rückmeldungen der Agent jeweils hatte.
Was an Portal für Agenten schwierig bleibt
Portal ist trotz des geschlossenen Rahmens ein anspruchsvolles Spiel für diesen Zweck. Viele Rätsel erfordern räumliches Vorstellungsvermögen, die richtige Reihenfolge von Aktionen und das Verständnis, dass ein sichtbares Hindernis über eine andere Ebene umgangen werden muss. Ein Agent darf zudem nicht jede Fehlentscheidung wiederholen, sondern muss aus einem misslungenen Versuch eine andere Hypothese bilden. Genau dort liegt der Unterschied zu einem System, das nur auf schnelle Bildschirmreize reagiert.
Der dokumentierte Lauf liefert zumindest einen Hinweis, dass ein allgemeines Sprachmodell mit geeignetem Werkzeugrahmen über längere Zeit konsistent planen und nachjustieren kann. GitHub beschreibt knapp 24 Stunden Laufzeit, darunter Wartezeiten und Kapazitätsunterbrechungen. Der Entwickler setzte nach eigenen Angaben zwischendurch fort und wechselte in einen schnelleren Modus. Die Zeitspanne ist deshalb kein sauberer Leistungswert. Sie zeigt aber, wie viel Infrastruktur und Geduld nötig waren, damit der Versuch überhaupt durchlief.
Warum der Abspann noch kein Benchmark ist
Mehrere Berichte beziffern die Nutzung zu Listenpreisen auf mindestens 570 Dollar. Außerdem war der Ablauf auf einen einzelnen Titel zugeschnitten: Die Pause-Funktion entschärfte Zeitdruck, der Controller lieferte Zustandsdaten, und das Spiel lief in einer bekannten, kontrollierbaren Umgebung. Ein echter Vergleichstest müsste verschiedene Spiele, neue Aufgaben, gleiche Budgets und identische Werkzeuge vorgeben. Er müsste auch Fehlschläge, Wiederholungen und menschliche Eingriffe vollständig erfassen.
Der Entwickler selbst bezeichnet den Lauf nicht als offiziellen Benchmark. Das ist die richtige Einordnung. Ein einzelnes erfolgreiches Langzeitbeispiel kann zeigen, welche Art von Verhalten heute möglich ist; es kann nicht zuverlässig sagen, wie oft das unter anderen Bedingungen gelingt. Auch die hohen Kosten verzerren den Vergleich: Ein Agent, der viele Stunden nachdenkt, kann bei einem Spiel faszinieren, ist aber für viele Arbeitsabläufe erst dann wirtschaftlich, wenn er deutlich schneller oder gezielter arbeitet.
Was sich auf die Praxis übertragen lässt
Die nützlichste Lehre liegt nicht im Spiel, sondern im Arbeitsablauf. Gute Agenten brauchen ein klares Ziel, begrenzte Werkzeuge, überprüfbare Zwischenergebnisse und eine Möglichkeit zum Anhalten. Genau darum ging es auch in unserer Einordnung zu OpenAIs Prompting-Anleitung für GPT-6 Astra: Mehr Eigenständigkeit macht präzise Aufgaben, Tests und Abbruchkriterien wichtiger, nicht überflüssig. Der Portal-Aufbau zeigt dieses Prinzip anschaulich, weil jede Aktion kontrolliert und jedes Ergebnis erneut gelesen wird.
Für Unternehmen bedeutet das: Ein Agent sollte zunächst in einem eng abgegrenzten Prozess arbeiten, in dem er nur die nötigen Daten und Berechtigungen erhält. Bei riskanten Aktionen müssen Menschen oder feste Regeln den letzten Schritt kontrollieren. Das ist weniger spektakulär als ein autonomer Bildschirmrekord, aber näher an dem, was bei Softwarewartung, Recherche oder internen Abläufen tatsächlich verlässlich funktioniert.
Ausblick: Fortschritt, der nach besseren Prüfungen verlangt
Der Portal-Lauf ist ein überzeugendes Anschauungsbeispiel für den Fortschritt langer Agentenketten. Er zeigt Planung, Wahrnehmung und Werkzeugnutzung zusammen, statt nur eine einzelne Modellantwort zu bewerten. Zugleich erinnert er daran, dass eine sorgfältig gebaute Testumgebung Teil der Leistung ist. Je mehr Rechte Agenten in der Praxis erhalten, desto wichtiger werden transparente Protokolle, unabhängige Wiederholungen und klare Grenzen. Der interessante nächste Schritt ist daher nicht, ob ein Modell noch ein Spiel beendet, sondern ob dieselbe Disziplin bei neuen, nützlichen und sicher begrenzten Aufgaben bestehen bleibt.

