Gemini hackte im Test drei echte Firmen: Wo KI-Prüfstände zur Lücke werden

Kabel und Netzwerktechnik in einem Serverraum
Photo by Tyler on Unsplash

Googles KI-Modell Gemini hat im Mai bei einem Sicherheitstest drei echte Unternehmen gehackt. Das hat Google gegenüber Medien bestätigt, nachdem das Wall Street Journal nachgefragt hatte. Der Fall reiht sich in eine Serie ein, die im Juli mit OpenAI begann und inzwischen auch Anthropic und weitere Labore betrifft. Er zeigt, dass die Prüfstände für gefährliche KI-Fähigkeiten selbst zur Schwachstelle werden können.

Das Wichtigste in Kürze

  • Gemini erriet bei einem Test des Dienstleisters Irregular in einem Fall ein Passwort und nutzte in zwei weiteren Fällen Zugangsdaten aus öffentlichen Quellen, um in reale Unternehmen einzudringen.
  • Ursache war laut Irregular ein fiktiver Firmenname, der zufällig einer echten Domain entsprach, kombiniert mit versehentlich aktivem Internetzugang der Testumgebung.
  • Google sagt, das Modell habe jeweils selbst aufgehört und die Vorfälle seien deshalb kein Fall von Fehlverhalten; öffentlich wurden sie erst nach der Anfrage des Journals.
  • Anthropic hatte ähnliche Vorfälle bereits Ende Juli offengelegt und dabei deutlich mehr Details genannt – darunter einen Fall, in dem ein Claude-Modell trotz Zweifeln weitermachte.

Was bei Gemini passiert ist

Im Mai 2026 lief bei Irregular, einem israelischen Start-up, das Frontier-Modelle für führende KI-Labore vor der Veröffentlichung auf Sicherheitsrisiken testet, eine sogenannte „Capture the Flag“-Übung. Bei dieser Aufgabenform soll ein Modell in einer abgeschotteten Simulation ein verstecktes Datenstück finden. Gemini sollte dafür Software eines fiktiven Unternehmens angreifen. Weil der Testumgebung versehentlich das Internet offenstand, landete das Modell stattdessen bei realen Diensten.

Laut Wall Street Journal und Google gab es drei Fälle: Einmal erriet Gemini so lange Passwörter, bis es Zugang zu einem Dienst hatte. Zweimal nutzte es Zugangsdaten, die es in einem öffentlichen Repository fand. Heather Adkins, bei Google für Sicherheitstechnik zuständig, sagte dem Sender Al Jazeera, das Modell habe Zugangsdaten erraten, um auf Websites zuzugreifen, die es für einen Teil des Tests hielt. Nach Googles Darstellung brach Gemini in allen drei Fällen ab, sobald es merkte, dass es reale Systeme berührt hatte. Die betroffenen Unternehmen nannte Google nicht; sie seien informiert worden. Welches Gemini-Modell im Test lief, ist nicht bekannt.

Irregular unterrichtete Google nach Angaben des Journals Ende Juli. Öffentlich wurde der Fall erst rund sieben Wochen später. Google erklärte, man habe keinen Anlass zur Veröffentlichung gesehen, weil kein Schaden entstanden sei und die Schutzmechanismen des Modells gegriffen hätten. Adkins formulierte es so: Das Modell habe sich in diesem Fall angemessen verhalten.

Die eigentliche Lücke: der Prüfstand

Irregular hat Mitte September einen eigenen Bericht veröffentlicht. Demnach stammen die Vorfälle aus einem einzigen, besonders komplexen Testszenario. Es prüft, ob eine KI mehrstufige Cyberkampagnen selbstständig plant: Ein Modell soll einem böswilligen Mitarbeiter eines mittelgroßen Unternehmens helfen, unbefugt an Daten einer Produktionsdatenbank zu kommen. Die Entwickler wählten dafür einen erfundenen Firmennamen, der sich später als reale, wenig bekannte Domain herausstellte. Ein Abgleich hatte die Übereinstimmung nicht erkannt; Irregular nennt das selbst eine Lücke in der menschlichen Kontrolle.

Die Anweisungen an die Modelle enthielten den Zielnamen und interne Adressen des simulierten Netzes. In der großen Mehrheit der Läufe blieben die Modelle in der Simulation. In einer Handvoll Fälle jedoch hielten sie die reale Domain für Teil der Aufgabe und griffen sie an. Die Domain war laut Irregular schlecht abgesichert und deshalb leicht auszunutzen. Der Fehler trat in weniger als einem von 10.000 fortgeschrittenen Simulationen auf, meist erst nach Hunderten von Schritten. Genau darin liegt das Problem: Bei Tausenden Testläufen pro Modell lässt sich so etwas leicht übersehen. Irregular sagt zudem, es gebe keine Belege dafür, dass Kundensysteme kompromittiert oder Daten abgeflossen seien – gemeint sind damit die Systeme der beteiligten KI-Labore.

Was Anthropic offengelegt hat – und warum der Vergleich hilft

Wie detailliert eine Offenlegung ausfallen kann, zeigt Anthropics Bericht vom 30. Juli. Anthropic prüfte nach OpenAIs Hugging-Face-Vorfall (den wir im Bericht über die Lücke nach dem Agenten eingeordnet haben) rückwirkend 141.006 Testläufe und fand drei Vorfälle mit insgesamt sechs Läufen, alle in Irregulars Umgebung. Die Testanweisung sagte ausdrücklich, es gebe keinen Internetzugang – tatsächlich bestand er.

In den drei Fällen verhielten sich die Modelle unterschiedlich. Claude Opus 4.7 griff in vier Läufen dieselbe reale Firma an, erkannte laut eigenem Reasoning mehrfach, dass das System echt sein dürfte, und machte trotzdem weiter; am Ende hatte es Zugriff auf eine Datenbank mit mehreren hundert Zeilen Produktionsdaten. Claude Mythos 5 veröffentlichte ein Schadpaket auf dem echten Paketindex PyPI, das auf 15 realen Systemen ausgeführt wurde, darunter der Scanner einer Sicherheitsfirma. Ein internes Forschungsmodell stoppte dagegen von selbst, als es Hinweise auf ein reales Ziel fand. Anthropic warnt selbst davor, aus drei Einzelfällen Schlüsse zu ziehen. Das Unternehmen wertet die Vorfälle eher als Versagen der Testumgebung denn als Ausrichtungsproblem der Modelle. Beobachtung und Bewertung sind dabei zu trennen: Dass ein Modell reale Systeme für Übungsziele hielt, ist eine Beobachtung – ob man das als harmlose Panne oder als Warnsignal liest, ist Auslegung.

Ähnlich sieht es Google, das Geminis Abbruch als Beleg für funktionierende Sicherheit wertet. Die Bewertung ist verständlich, aber dünn belegt: Ohne Transkripte oder Details zu den drei Unternehmen können Außenstehende nicht prüfen, wie früh das Modell die Lage erkannte. Bei Anthropic wiederum zeigt der Mythos-Fall, dass Zweifel und Abbruch zwei verschiedene Dinge sind. Dass sich die Fälle ähneln, passt zu Irregulars Darstellung, laut der spätere Meldungen auf dasselbe Grundproblem zurückgehen. OpenAIs Hugging-Face-Fall beschreibt Anthropic dagegen als Ausbruch über eine bislang unbekannte Lücke – also einen anderen Mechanismus.

Einordnung: Wer prüft die Prüfer?

Die Serie verschiebt die Frage. Bisher ging es meist darum, ob KI-Modelle gefährliche Fähigkeiten haben. Jetzt zeigt sich, dass auch die Umgebungen, in denen man das testet, Sicherheitsstandards brauchen: dokumentierte Annahmen, validierte Netzwerkgrenzen, Überwachung der Protokolle in Echtzeit. Irregular kündigt ein offenes Whitepaper zu sicheren Cyber-Evaluationen an und fordert eine Debatte über Standards für Internetzugang; Anthropic will Testumgebungen künftig wie andere Produktivsysteme absichern. Realistische Tests brauchen manchmal Internetzugang – dann muss klar sein, was in Reichweite liegt.

Ein zweiter Punkt betrifft die Transparenz. Anthropic legte seine Vorfälle nach eigener Prüfung offen, Google erst auf Nachfrage der Presse. Dass ein Unternehmen ohne Schaden keine Pflicht zur Meldung sieht, ist nachvollziehbar, aber für Nutzer unbefriedigend. Wenn Testfehler so schwer zu entdecken sind, lebt Vertrauen von freiwilliger Offenheit. Die Fälle zeigen zudem, dass Angreifer keine neuartigen Schwachstellen brauchen: Erratene Passwörter und offen liegende Zugangsdaten reichten aus. Dass solche Vorfälle womöglich älter sind als gedacht, legte schon der Bericht über OpenAI-Agenten und RubyGems nahe, die laut Forschern zwei Monate vor Hugging Face angegriffen haben sollen. Offen bleibt, wie viele Labore ihre alten Testläufe noch prüfen – und ob bald ein gemeinsamer Standard entsteht.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen