
Seit Jahren kursieren in Entwicklerforen frei verfügbare KI-Modelle, denen jemand die eingebauten Schutzmechanismen herausgerechnet hat. Neu ist, dass daraus ein Unternehmen geworden ist: Das Startup Abliteration.ai betreibt solche Modelle als bezahlten Dienst mit Web-Oberfläche, API und Cloud-Infrastruktur. TechCrunch hat den Anbieter am 3. September 2026 getestet und dabei Antworten erhalten, die jedes kommerzielle Modell verweigern würde.
Das Wichtigste in Kürze
- Abliteration.ai hostet Open-Weight-Modelle, aus deren Gewichten das Verweigerungsverhalten entfernt wurde, darunter GLM-5.3 des chinesischen Anbieters Z.ai.
- Im Test von TechCrunch lieferte das Modell Python-Code zum Auslesen gespeicherter Chrome-Passwörter und ein Protokoll zur Kultivierung eines gefährlichen Erregers.
- Eine Identitätsprüfung findet nicht statt: Das Unternehmen protokolliert lediglich die Kreditkarte, mit der bezahlt wird.
- Als Zielgruppe nennt Mitgründer Devon Sicherheitsforscher, Red-Teaming-Firmen und Konzerne aus kritischer Infrastruktur.
- Die zugrundeliegende Technik ist seit 2024 öffentlich dokumentiert und kostenlos verfügbar. Kommerziell ist neu, dass sie jetzt als Dienstleistung verkauft wird.
Was Abliteration technisch bedeutet
Der Kunstbegriff setzt sich aus ablate (entfernen) und obliterate (auslöschen) zusammen und beschreibt einen chirurgischen Eingriff in ein fertig trainiertes Sprachmodell. Grundlage ist ein Befund aus dem Jahr 2024: Ob ein Modell eine Anfrage ablehnt, hängt maßgeblich an einer einzigen Richtung in seinem internen Aktivierungsraum. Wer diese Richtung ermittelt, indem er die Reaktionen auf harmlose und auf heikle Anfragen vergleicht, kann sie anschließend aus den Gewichtsmatrizen herausprojizieren.
Das Ergebnis ist ein Modell, das seine Fähigkeiten weitgehend behält, aber kaum noch ablehnt. Ein erneutes Training ist dafür nicht nötig, der Eingriff dauert auf handelsüblicher Hardware Minuten. Er funktioniert allerdings nur bei Modellen, deren Gewichte frei heruntergeladen werden können. Geschlossene Systeme wie GPT, Claude oder Gemini sind nur über die Schnittstelle ihrer Anbieter erreichbar und dieser Methode entzogen. Neuere Arbeiten aus dem Jahr 2026 zeigen zudem, dass das Bild komplizierter ist als gedacht: Verweigerung wird nicht von einer, sondern von mehreren unabhängigen Richtungen getragen. Praktisch ändert das wenig, die Werkzeuge dafür liegen als Anleitung und fertiger Code im Netz.
Das Geschäftsmodell und seine Kundschaft
Abliteration.ai entstand Ende 2025 als Nebenprojekt und wurde im März 2026 offiziell eingetragen. Mitgründer Devon, der seinen Nachnamen nicht nennt und weiterhin bei einem anderen Unternehmen angestellt ist, beschreibt das Angebot als Werkzeug für die Verteidigung: Wer Angriffe simulieren will, brauche ein Modell, das den Angreifer auch spielt. Verteidiger sollen sich, so seine Formulierung gegenüber TechCrunch, so schnell bewegen können wie die Gegenseite.
Zu den Kunden zählen laut Bericht junge Red-Teaming-Firmen aus Großbritannien und Europa sowie Banken, Fluggesellschaften und Betreiber kritischer Infrastruktur. Risikokapital hat das Unternehmen bislang nicht aufgenommen, es finanziert seine Verträge mit großen Cloud-Anbietern aus laufenden Einnahmen und verhandelt derzeit über eine Finanzierungsrunde. Für Firmenkunden bietet die Plattform eine Moderationsschicht an, über die sich eigene Leitplanken wieder einziehen lassen. Das ist die bemerkenswerteste Volte des Modells: Der Dienst entfernt Schutzmechanismen und verkauft anschließend die Möglichkeit, passende neue einzubauen.
Wo die Argumentation bricht
Das Verteidigungsargument ist nicht abwegig. Sicherheitsteams testen Systeme seit jeher mit denselben Werkzeugen, die Angreifer benutzen, und ein Modell, das bei jeder heiklen Frage abschaltet, taugt für diese Arbeit schlecht. Der Bruch liegt woanders, nämlich bei der Frage, wer den Dienst überhaupt nutzen darf. Eine hinterlegte Kreditkarte ist kein Identitätsnachweis, und ein kostenloser Browser-Zugang ohne Prüfung macht die Zielgruppenbeschreibung zur Absichtserklärung. Devon räumt selbst ein, dass die Zuständigkeitsfrage noch nicht geklärt sei.
Andrew Yoon von der Sicherheitsorganisation CivAI formuliert die Kritik drastisch: Abliteration verändere ein Modell so, dass es zum Soziopathen werde. Wichtiger als das Bild ist die Unterscheidung dahinter. Bei Cyberfähigkeiten liefert ein enthemmtes Modell Angreifern vor allem Zeitersparnis; das Wissen selbst ist in Sicherheitskreisen ohnehin verfügbar. Bei biologischen Protokollen sieht die Rechnung anders aus, weil hier fehlendes Spezialwissen die eigentliche Hürde ist. Dass die etablierten Anbieter genau an dieser Stelle bremsen, zeigt der Fall, in dem OpenAI Teile der Astra-Entwicklung wegen zu starker Cyberangriffs-Fähigkeiten gestoppt hat. Wie brüchig Leitplanken selbst dort sind, wo sie eingebaut bleiben, führt die versteckte Prompt-Injektion in Dokumenten vor.
Eine offene Rechtsfrage
Ungeklärt ist auch, wer für ein derart verändertes Modell einsteht. Die Lizenzen offener Modelle enthalten in der Regel Nutzungsregeln, die genau solche Anwendungen ausschließen; durchgesetzt werden sie selten. Auf europäischer Seite rückt der EU AI Act denjenigen, der ein Modell wesentlich verändert und weitergibt, grundsätzlich in die Rolle eines Anbieters mit eigenen Pflichten. Ein Dienst, der Schutzmechanismen systematisch entfernt, ist dafür ein Musterfall, den bislang niemand durchgespielt hat. Dass viele der betroffenen Modelle aus China stammen, macht die Zuständigkeit nicht einfacher.
Was daraus folgt
Abliteration.ai ist weniger ein technischer als ein wirtschaftlicher Vorgang. Die Methode war frei, das Werkzeug war frei, neu ist die Bequemlichkeit: Wer bisher Gewichte herunterladen, Hardware mieten und Code ausführen musste, öffnet jetzt eine Webseite. Genau diese Reibungslosigkeit entscheidet in der Praxis darüber, wer eine Fähigkeit nutzt. Der Testfall der kommenden Monate ist deshalb nicht, ob sich enthemmte Modelle bauen lassen, sondern ob sich ein Markt bildet, auf dem ernsthafte Zugangskontrolle zum Wettbewerbsnachteil wird. Sollte das passieren, verschiebt sich die Sicherheitsdebatte weg von der Frage, wie gut ein Modell trainiert ist, hin zu der viel unbequemeren, wer es hosten darf.

