Kolibri von Aleph Alpha: Was das offene deutsche KI-Modell kann

Ein Kolibri in Nahaufnahme
Photo by Dulcey Lima on Unsplash

Aleph Alpha hat am 3. Oktober 2026 sein Sprachmodell Kolibri veröffentlicht, mit vollständigen Gewichten auf Hugging Face und unter der freien Apache-2.0-Lizenz. Das Heidelberger Unternehmen hat das Modell von Grund auf selbst trainiert, auf Rechnern in Deutschland und Finnland und mit Deutsch als gleichberechtigter Sprache neben Englisch. Damit legt ein deutsches Unternehmen wieder ein offenes Modell vor, das mit aktuellen Konkurrenten seiner Klasse mithält und das Behörden und Unternehmen auf eigener Hardware betreiben können.

Das Wichtigste in Kürze

  • Kolibri hat 78,1 Milliarden Parameter, von denen pro Wort-Baustein nur 3,46 Milliarden rechnen. Diese Bauweise hält die Rechenkosten niedrig, verlangt aber viel Speicher.
  • Gut ein Fünftel der 20 Billionen Trainings-Tokens ist deutscher Text, ein eigener Tokenizer zerlegt deutsche Komposita effizienter. Der Kontext reicht laut Aleph Alpha bis gut eine Million Tokens.
  • In Aleph Alphas eigenen Vergleichen liegt Kolibri knapp vor ähnlich effizienten offenen Modellen wie Qwen3.5 35B-A3B, aber deutlich hinter dem dichteren Qwen3.8 27B. Unabhängige Messungen fehlen noch.
  • Für den Betrieb braucht es rund 78 Gigabyte Grafikspeicher, offiziell mindestens zwei A100- oder H100-Karten oder eine H200. Eine offizielle Fassung für Ollama oder LM Studio gibt es noch nicht.
  • Kolibri erscheint, während Aleph Alpha mit dem kanadischen Anbieter Cohere fusioniert; die Behörden müssen noch zustimmen.

Was in dem Modell steckt

Kolibri ist ein sogenanntes Mixture-of-Experts-Modell. Statt bei jedem Wort das gesamte Netz zu befragen, wählt eine Weiche in jeder der 50 Schichten sechs von 384 spezialisierten Teilnetzen aus, dazu kommt ein gemeinsamer Experte. So steckt das Wissen eines 78-Milliarden-Modells im Speicher, während die Rechenlast eher der eines Modells mit drei bis vier Milliarden Parametern entspricht. Aleph Alpha hat die Größe bewusst nach Betriebskosten gewählt: Eine getestete Variante mit 123 Milliarden Parametern hätte auf zwei H100-Karten nur drei Anfragen mit sehr langem Kontext gleichzeitig verarbeitet, Kolibri schafft 18 und erzeugt Text 28 Prozent schneller.

Auch die Aufmerksamkeit, also der Mechanismus, mit dem das Modell frühere Textstellen berücksichtigt, ist auf Sparsamkeit getrimmt. Nur 10 der 50 Schichten blicken über den ganzen Kontext, die übrigen 40 sehen jeweils die letzten 512 Tokens. Trainiert wurde mit 262.144 Tokens Kontext, Aleph Alpha hat die Qualität aber bis 1.048.576 Tokens geprüft, das sind grob 700.000 englische Wörter. Für zeitkritische Anwendungen empfiehlt der Hersteller selbst, unter der kleineren Grenze zu bleiben. Wie viel Rechenaufwand das Modell in eine Antwort steckt, lässt sich in vier Stufen von „none“ bis „high“ einstellen.

Deutsch als Trainingssprache, nicht als Übersetzung

Der interessanteste Teil der Veröffentlichung betrifft die Daten. Aus Experimenten mit kleinen Modellen leitete Aleph Alpha ab, dass rund 20 Prozent deutscher Text das beste Ergebnis bringen. Bei 20 Billionen Trainings-Tokens wären das rund vier Billionen deutsche Tokens gewesen. Offene deutsche Datensätze lieferten nach Bereinigung nur 390 Milliarden. Den Rest holte das Team auf zwei Wegen: mit einer eigenen Aufbereitung des Webarchivs Common Crawl, die 1,3 Billionen Tokens deutschen Originaltext ergab, und mit rund einer Billion Tokens, in denen ein Sprachmodell deutsche Texte in neue Formen umschrieb, etwa als Lexikoneintrag oder Frage-Antwort-Dialog.

Ein Detail aus dem Blogbeitrag zeigt, warum das nötig war: Gängige Filter sortieren Texte mit zu vielen langen Wörtern als minderwertig aus. Deutsche Verwaltungsprosa überschreitet die für Englisch gesetzte Grenze routinemäßig, die Standardeinstellung hätte also genau die Sprache entfernt, in der Behörden schreiben. Übersetzungen aus dem Englischen hat das Team dagegen nur sparsam eingesetzt, weil ein übersetzter Korpus die Welt des englischsprachigen Netzes mitbringt: Präsident statt Kanzler. Dazu kommt ein eigener Tokenizer, der deutsche Komposita besser in Bausteine zerlegt und laut Modellkarte 4,7 Bytes deutschen Text pro Token verarbeitet. Je weniger Tokens ein Text braucht, desto günstiger und schneller ist jede Anfrage.

Wo Kolibri im Vergleich steht

Aleph Alpha vergleicht Kolibri vor allem mit Modellen, die ähnlich wenige Parameter pro Token aktivieren. In dieser Klasse liegt es im Gesamtschnitt vorn: 75,5 Punkte auf Englisch und 70,8 auf Deutsch, gegenüber 74,7 und 69,8 bei Qwen3.5 35B-A3B und 73,0 und 67,9 beim deutlich größeren Nemotron 3 Super 120B-A12B. Bei Mathematik-Aufgaben wie AIME 2025 erreicht Kolibri auf Englisch 96,9 Prozent. Ehrlicherweise führt die Modellkarte auch das dichte Qwen3.8 27B mit, das pro Token rund achtmal so viele Parameter nutzt und mit 80,2 und 79,9 Punkten klar vorn liegt, besonders auf Deutsch. Alle Zahlen stammen aus Aleph Alphas eigenem Testaufbau; unabhängige Ranglisten führen das Modell bislang nicht.

Auffällig ist ein Schwerpunkt, den Benchmarks selten belohnen: Kolibri wurde darauf trainiert, „Ich weiß es nicht“ zu sagen, wenn eine Antwort nicht im vorliegenden Dokument steht. In einem Test, der genau dieses Verweigern prüft, erreicht es 85,6 Prozent. Für Behörden und Unternehmen, die das Modell auf eigene Akten loslassen wollen, ist das wichtiger als ein Prozentpunkt mehr in einem Mathetest. Aleph Alphas interne Branchentests, etwa für den deutschen öffentlichen Sektor, zeigen deutliche Fortschritte gegenüber dem nie veröffentlichten Vorgänger Kolibri Origin, lassen sich von außen aber nicht nachprüfen.

Wer Kolibri nutzen kann

Die Apache-2.0-Lizenz erlaubt auch kommerzielle Nutzung ohne Zusatzbedingungen. Die Hürde ist die Hardware. In der Standardfassung mit 8-Bit-Gewichten belegt Kolibri rund 78 Gigabyte; offiziell nennt Aleph Alpha als Minimum zwei A100- oder H100-Karten mit je 80 Gigabyte oder eine einzelne H200 oder B200. Betrieben wird es über die Server-Software vLLM mit einem eigenen Zusatzpaket, das eine zur OpenAI-Schnittstelle kompatible Programmierschnittstelle bereitstellt. Bestehende Anwendungen lassen sich damit oft durch Ändern einer Adresse umstellen. Das Modell versteht Werkzeugaufrufe und eignet sich damit auch für Agenten, die Suchen oder Programme anstoßen.

Für Bastler mit großem Rechner tut sich ebenfalls etwas. Binnen eines Tages tauchten auf Hugging Face inoffizielle, von Nutzern umgewandelte Fassungen auf, darunter stark komprimierte Varianten für Apples MLX und im GGUF-Format für llama.cpp; eine 4-Bit-Fassung im GGUF-Format ist 47,5 Gigabyte groß. Sie stammen nicht von Aleph Alpha. Die GGUF-Dateien setzen laut Beschreibung einen selbst gepatchten llama.cpp voraus und lassen sich deshalb in Ollama und LM Studio noch nicht laden. In Ollamas Bibliothek steht seit Kurzem zwar ein Nutzer-Upload in voller 16-Bit-Genauigkeit, mit 173 Gigabyte aber jenseits gewöhnlicher Rechner. Wer Kolibri lokal ausprobieren will, sollte daher auf offizielle Unterstützung in diesen Programmen warten. Wie Aleph Alpha in seiner gestern erschienenen Untersuchung zur politischen Färbung chinesischer Modelle argumentiert, zählt bei offenen Modellen zunehmend auch die Herkunft. Hier hat Kolibri ein echtes Argument.

Einordnung: Souveränität mit Fußnoten

Kolibri ist kein Spitzenmodell, und Aleph Alpha behauptet das auch nicht. Es ist ein Werkzeug für eine klar umrissene Aufgabe: deutsche und englische Dokumente in Behörden und Industrie verarbeiten, ohne Daten an fremde Cloud-Dienste zu schicken. Dafür ist die Kombination aus offener Lizenz, nachvollziehbarer Datenherkunft und moderaten Betriebskosten stimmig. Ganz ohne fremde Bausteine kommt aber auch Kolibri nicht aus: Die Modellkarte nennt Gemma 4 von Google, Mistral NeMo und Qwen3 als Helfer beim Erzeugen und Bewerten synthetischer Trainingsdaten. Und wem das Modell künftig gehört, entscheidet sich mit der Fusion: Am 16. September unterzeichneten Aleph Alpha und Cohere den Vertrag, das gemeinsame Unternehmen soll Cohere heißen und in Berlin und Toronto sitzen, Heidelberg bleibt Forschungsstandort. Die Gewichte von Kolibri liegen unter Apache 2.0 aber bereits offen im Netz, und das lässt sich nicht mehr zurücknehmen. Für deutsche Anwender ist das der eigentliche Wert dieser Veröffentlichung.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen