
Eine vertauschte Seitenwand fällt oft erst auf, wenn das Möbel fast fertig ist. KI könnte solche Fehler künftig früher erkennen: Epoch AI hat am 23. September einen Test veröffentlicht, in dem Modelle Fotos von IKEA-Möbeln mit den zugehörigen Bauanleitungen abgleichen. GPT-6 Astra löst darin 80 Prozent der Aufgaben korrekt. Der Befund zeigt einen greifbaren Fortschritt beim räumlichen Denken, aber noch keinen verlässlichen digitalen Möbelmonteur.
Das Wichtigste in Kürze
- Der Furniture Assembly Benchmark umfasst 60 Fotos von drei Möbelaufbauten, mit und ohne absichtlich eingebaute Fehler.
- GPT-6 Astra erreicht 80 Prozent, Claude Fable 5.1 folgt mit 70 Prozent und Claude Opus 5 mit 61 Prozent.
- Die Modelle erhalten neben dem Foto eine PDF-Bauanleitung sowie Werkzeuge zum Vergrößern und Analysieren der Bilder.
- Die schnellste geprüfte KI braucht im Median drei Minuten pro Foto. Der Test belegt keine fertige Echtzeit-Aufbauhilfe.
Eine Anleitung verstehen heißt mehr als Teile erkennen
Wer einen Aufbaufehler finden will, muss mehrere Darstellungen miteinander verbinden. Auf dem Foto liegt ein dreidimensionales Objekt, in der Anleitung stehen schematische Zeichnungen. Ein Brett kann aus dem Kamerawinkel ganz anders aussehen als auf dem Papier. Entscheidend ist nicht allein, ob das Modell eine Schraube oder Schublade erkennt. Es muss verstehen, welches Teil an welcher Stelle und in welcher Orientierung sitzen sollte.
Epoch AI verwendet Aufnahmen eines STÄLL-Schuhschranks, eines TONSTAD-Bettrahmens und einer GULLABERG-Kommode. Das Team baute bewusst Fehler ein und arbeitete teilweise weiter, bevor es fotografierte. Damit lässt sich die Aufgabe nicht auf die zuletzt montierte Komponente reduzieren. Ein sichtbarer Widerspruch kann aus einem früheren Arbeitsschritt stammen. Der Test ist unabhängig von IKEA; er ist keine gemeinsame Produktankündigung und kein vom Möbelhersteller angebotener Assistent.
Die Modelle müssen die fehlerhaften Schritte benennen und das Problem sinnvoll beschreiben. Ist der Aufbau korrekt, sollen sie zum nächsten Schritt weiterleiten. Dazu bekommen sie auch die Information, welcher Schritt gerade abgeschlossen wurde. Das ist eine hilfreiche Eingrenzung: Im Wohnzimmer müsste ein System diesen Stand möglicherweise erst ermitteln. Die Versuchsbedingungen und eine beiläufige Frage mit einem Handyfoto sind deshalb nicht austauschbar.
Eine offizielle Anleitung bleibt dabei das Fundament. IKEA stellt auf der Produktseite des TONSTAD-Betts Montageunterlagen bereit. Für eine praktische Anwendung wäre die genaue Zuordnung von Möbelvariante und Dokument entscheidend. Eine plausibel klingende Erklärung zur falschen Anleitung kann beim Aufbau genauso wenig helfen wie eine gut gelesene Zeichnung, die zu einem anderen Bauteil gehört.
Was die 80 Prozent tatsächlich aussagen
Im November 2025 lag der beste Wert unter den von Epoch geprüften Modellen bei 28 Prozent, erreicht von Claude Opus 4.5. Der aktuelle Bericht zeigt also einen deutlichen Sprung innerhalb von zehn Monaten. Er rekonstruiert die Entwicklung anhand ausgewählter Modelle; er vermisst nicht rückwirkend jedes damals verfügbare System. Diese Einschränkung ist für den Zeitvergleich wichtiger als eine möglichst eindrucksvolle Steigerungsformel.
Auch der heutige Spitzenwert ist eine Aufgabenquote auf einem kleinen Datensatz. Er bedeutet weder, dass eine KI 80 Prozent aller Möbel sicher zusammenbauen könnte, noch dass jeder einzelne Fehler mit dieser Wahrscheinlichkeit gefunden würde. Ein Foto kann mehrere Fehler zeigen. Bewertet wird, ob die geforderte Antwort für diese Aufnahme stimmt. Eine Zusage für andere Möbel, andere Räume oder verdeckte Montagefehler lässt sich daraus nicht ableiten.
Die Auswertung ist mehrstufig. Zunächst wird geprüft, ob das Modell die richtigen fehlerhaften Schritte nennt. Anschließend bewertet GPT-5.6 Sol die Beschreibung, mit der Vorgabe, großzügig zu urteilen, sofern der Fehler ungefähr richtig beschrieben ist. Ein solcher KI-Bewerter macht größere Vergleiche handhabbar, ist aber kein unabhängiger menschlicher Sachverständiger. Epoch hat zudem noch keinen menschlichen Vergleichswert für diesen Test gemessen. Aussagen wie „besser als erfahrene Monteure“ wären deshalb unbelegt.
Das interessante Signal liegt weniger im Gesamtranking als im Zusammenspiel von Dokument und Foto. Ein Modell muss eine technische Vorgabe an einem realen Gegenstand prüfen. Für künftige Assistenzprodukte wäre das ein anderer Nutzen als bloßes Bildbeschreiben: Sie könnten auf einen konkreten Widerspruch aufmerksam machen und die passende Stelle in der Anleitung nennen. Ob dieser Nutzen zuverlässig entsteht, muss eine Anwendung außerhalb des Benchmarks zeigen.
Wie sich die Idee heute sinnvoll ausprobieren lässt
Als vorsichtiger eigener Versuch eignet sich eine einzelne, überschaubare Frage während eines Möbelaufbaus. Dafür braucht es einen Dienst, der sowohl Fotos als auch das relevante Dokument verarbeiten kann. Das ist eine Übertragung der Testidee, keine von Epoch bestätigte Bedienungsanleitung für ein bestimmtes Chatprodukt. Auch die veröffentlichten Modellwerte gelten nur für den beschriebenen Versuchsaufbau.
Hilfreich wäre, die genaue Möbelbezeichnung, den zuletzt erledigten Schritt und die zugehörige Anleitungsseite zusammen mit einem gut beleuchteten Foto anzugeben. Die Frage sollte nicht bereits einen Fehler unterstellen: „Passt der sichtbare Aufbau zu diesem Schritt? Nenne die Stelle in der Anleitung, auf die sich deine Einschätzung stützt.“ Bei einer angeblich falschen Orientierung lässt sich dann direkt am Dokument prüfen, ob die Begründung trägt.
Für diesen Versuch zählt die Qualität des sichtbaren Ausschnitts. Eine Übersicht zeigt die Lage der Teile, eine Nahaufnahme kann eine Verbindung verständlicher machen. Nicht sichtbare Schrauben, verdeckte Beschläge oder die Festigkeit einer Verbindung bleiben aus einem Foto unbestimmt. Eine Antwort sollte deshalb als überprüfbarer Hinweis behandelt werden. Sie ersetzt weder die vollständige Herstelleranleitung noch eine tatsächliche Prüfung des montierten Möbels.
Der nächste Fortschritt muss im Aufbaualltag bestehen
Drei Minuten im Median sind für eine punktuelle Nachfrage möglicherweise hinnehmbar, für fortlaufende Begleitung aber eine merkliche Pause. Dazu kommt die offene Frage, wie gut der Befund auf weitere Möbel und alltägliche Aufnahmen übertragbar ist. Ein nützlicher Aufbauassistent müsste nicht nur Fehler finden, sondern auch korrekte Arbeitsschritte bestätigen, fehlende Sicht erkennen und bei unklaren Fotos gezielt nachfragen.
Der neue Test macht eine solche Entwicklung messbar. Er zeigt, dass die Verbindung zwischen Anleitung und Gegenstand nicht mehr nur eine anschauliche Zukunftsidee ist. Der nächste überzeugende Schritt wäre eine breitere Prüfung mit vielfältigen Möbeln, unterschiedlichen Kamerawinkeln und Menschen beim tatsächlichen Aufbau. Erst dann würde aus einem guten Laborwert ein belastbarer Alltagsnutzen: weniger Zurückbauen, weil ein falsch ausgerichtetes Teil rechtzeitig auffällt.

