
Offene KI-Modelle aus China gehören zu den leistungsfähigsten, die man frei herunterladen kann, und sie stecken längst in Produkten westlicher Firmen. Eine Untersuchung des Heidelberger KI-Unternehmens Aleph Alpha zeigt nun, wie stark Modelle von Alibaba, DeepSeek und Moonshot AI bei politisch heiklen Fragen der Linie Pekings folgen. Und sie zeigt, dass sich diese Färbung über Trainingsdaten auch in Modelle anderer Hersteller weitertragen kann. Wer chinesische Modelle einsetzt, muss sie deshalb nicht meiden, sollte aber wissen, wofür sie taugen.
Das Wichtigste in Kürze
- Aleph Alpha hat sechs chinesische Modelle mit 967 politisch sensiblen Fragen geprüft; nur 17 bis 41 Prozent der Antworten fielen ausgewogen aus.
- Die übrigen Antworten übernahmen Positionen der Kommunistischen Partei Chinas oder verweigerten die Auskunft. DeepSeek V4 Pro lehnte rund zwei Drittel der Fragen ab.
- Auch Nvidias Modell Nemotron Cascade 2 zeigte bei rund 17 Prozent der Fragen parteinahe Muster, vermutlich übernommen aus Trainingsdaten, die mit DeepSeek und Qwen erzeugt wurden.
- Claude Sonnet 5 und Mistral Small übernahmen nur in 2,8 beziehungsweise 8 Prozent der Fälle die Parteisicht.
- Aleph Alpha ist nicht neutral: Das Unternehmen hat am 3. Oktober ein eigenes offenes Modell veröffentlicht und fusioniert mit dem kanadischen Anbieter Cohere.
Was Aleph Alpha gemessen hat
Der Bericht trägt den Titel „Training on the Party Line“ und erschien am 28. September, verfasst von Bastian Boll. Grundlage ist ein eigener Fragenkatalog: Aleph Alpha wählte 56 politisch heikle Themen aus, darunter Taiwan, Xinjiang, das Tiananmen-Massaker und Zensur, und ließ daraus vom offenen Modell GPT-OSS 120B 967 konkrete Aufträge erzeugen. Ein Beispiel ist der Auftrag, eine Unterrichtsstunde über den Personenkult um Xi Jinping zu entwerfen. Dasselbe GPT-OSS-Modell ordnete die Antworten anschließend in drei Gruppen ein: übernimmt die Sicht der Partei, antwortet ausgewogen, verweigert.
Die Ergebnisse fallen deutlich aus. Qwen 3.6 in der Variante 35B-A3B antwortete nur in 17 Prozent der Fälle ausgewogen und übernahm in 80 Prozent die Parteisicht. DeepSeek R1 in der Fassung vom Mai 2025 kam auf 22 Prozent ausgewogene Antworten. Das deutlich größere Qwen 3.8 lag bei 19 Prozent. Besser schnitten die Modelle von Moonshot AI ab: Kimi K2.5 erreichte 37 Prozent, das aktuelle Kimi K3 41 Prozent. DeepSeek V4 Pro wählte einen anderen Weg: Es übernahm nur in 16 Prozent die Parteiposition, verweigerte aber 66 Prozent der Antworten. Zum Vergleich: Claude Sonnet 5 antwortete in 70 Prozent ausgewogen und lehnte 27 Prozent ab, Mistral Small antwortete in 92 Prozent ausgewogen.
Ein zweiter Test mit 240 Fragen, die China gar nicht erwähnen, fiel für die meisten Modelle deutlich harmloser aus; dort antworteten sie überwiegend ausgewogen. Auffällig bleibt Kimi K3, das laut Aleph Alpha auch bei diesen Fragen in 93 Prozent der Fälle die Parteisicht übernahm. Eine Erklärung für diesen Ausreißer liefert der Bericht nicht.
Wie sich die Linie in andere Modelle vererbt
Der interessanteste Befund betrifft kein chinesisches Modell. Nvidias Nemotron Cascade 2 übernahm bei rund 17 Prozent der Fragen die Parteisicht. Aleph Alpha hat nachgesehen, woher das kommen könnte: Nvidia hat die Daten für das Feintuning veröffentlicht, und diese wurden zu großen Teilen mit DeepSeek und Qwen erzeugt. Unter 9,3 Millionen Dialogzeilen fanden sich rund 3.500 mit Positionen der Partei. Ein winziger Anteil, der trotzdem messbar durchschlägt.
Das ist für die Praxis bedeutsam, weil es gängig ist, kleinere Modelle mit den Antworten großer Modelle zu trainieren oder auf deren Basis aufzubauen. So beruhen etwa auch Cloudflares neue Entscheidungsmodelle Clef auf Qwen. Ob ein solches Derivat die politische Färbung behält, hängt davon ab, wofür es gebaut ist und wie es weitertrainiert wurde. Ein Modell, das Support-Tickets sortiert, stellt sich die Frage nach Taiwan nie. Die Herkunft eines Modells zu kennen, wird aber zur Grundausstattung.
Ein Befund mit Absender
Die Zahlen sind plausibel, aber sie kommen nicht aus neutraler Quelle. Aleph Alpha verkauft sich als Anbieter „souveräner“ KI für Behörden und Industrie und hat am 3. Oktober sein offenes Modell Kolibri veröffentlicht, mit 78 Milliarden Parametern unter der Apache-2.0-Lizenz. Zugleich hat das Unternehmen im September die Fusion mit dem kanadischen Anbieter Cohere unterzeichnet; die Behörden müssen noch zustimmen. Eine Studie, die chinesische Konkurrenz als politisch belastet zeigt, passt gut in diese Erzählung. Hinzu kommt eine methodische Einschränkung, die Aleph Alpha selbst nennt: Ein KI-Modell hat die Fragen erzeugt und die Antworten bewertet, und gerade bei schwierigen Abwägungen kann ein solcher Richter verzerren. Der Bericht listet im Anhang die 56 Themen, einen Link zum vollständigen Fragenkatalog enthält er nicht.
Gestützt wird der Befund durch unabhängige Forschung. Das slowakische Forschungsinstitut CEIAS hat im Juli 5.760 Fragen zu 37 Ländern und 40 Themen an DeepSeek V3.2, Kimi K2.5, Qwen 3.5 und GLM-5 gestellt. Bei heiklen Themen lenkte Kimi etwa jede dritte Antwort auf chinesische Regierungsbotschaften um, DeepSeek etwa jede vierte, selbst wenn es um ganz andere Länder ging. Auf Mandarin war der Effekt bei den zehn auffälligsten Themen mehr als doppelt so stark wie auf Englisch: 59 statt 24 Prozent.
Was Nutzer daraus machen sollten
Für die meisten Alltagsaufgaben spielt die politische Färbung keine Rolle. Wer mit DeepSeek oder Kimi programmiert, Texte zusammenfasst oder Daten auswertet, bekommt die Stärken dieser Modelle, oft zu einem Bruchteil der Kosten westlicher Angebote. Über Ollama lassen sich etwa DeepSeek V4 Pro und Kimi K3 auch in der Cloud nutzen oder kleinere Varianten lokal betreiben. Anders sieht es aus, sobald ein Modell Nachrichten einordnet, Unterrichtsmaterial erstellt, Bürgeranfragen beantwortet oder sonst mit Politik, Geschichte und Menschenrechten zu tun hat. Dort gehört ein westliches oder europäisches Modell in die Auswahl, oder zumindest ein eigener Test mit einer Handvoll heikler Fragen, bevor ein System in Betrieb geht.
Aleph Alpha empfiehlt Entwicklern drei Schritte: Trainingsdaten auf politische Inhalte aus China prüfen, gezielte Daten für das gewünschte Verhalten ergänzen und Modelle gegen Prüfkataloge wie den eigenen testen. Das ist für jeden sinnvoll, der fremde Modellantworten als Trainingsmaterial verwendet.
Fazit: Herkunft wird zur Produkteigenschaft
Die Studie macht sichtbar, was bisher vor allem als Vermutung kursierte: Die Vorgaben, die Peking seinen KI-Anbietern macht, reisen mit den Modellgewichten um die Welt und können über Trainingsdaten sogar in amerikanische Modelle sickern. Daraus folgt kein Pauschalverbot, wohl aber eine neue Sorgfaltspflicht. Wer ein offenes Modell auswählt, sollte künftig nicht nur Benchmarks für Code und Mathematik vergleichen, sondern auch fragen, woher es stammt und womit es trainiert wurde. Ein öffentlich zugänglicher, unabhängig gepflegter Prüfkatalog für solche Fragen wäre der nächste sinnvolle Schritt, idealerweise nicht von einem Anbieter, der selbst Modelle verkauft.
Quellen
- Aleph Alpha: Training on the Party Line – Chinese Political Influence on LLMs in China and the World
- The Decoder: Chinesische KI-Modelle wiederholen bei sensiblen Themen Staatsdoktrin
- CEIAS: Chinese LLMs and the Spillover Effects of Political Alignment
- Trending Topics: Aleph Alpha's Kolibri Is No Match for the Open-Weight Leaders
- SiliconANGLE: Cohere and Aleph Alpha agree to merge
- Ollama: Cloud-Modelle

