Cloudflare Clef: Offene KI-Modelle, die entscheiden statt schreiben

Serverschrank mit sauber verlegten Netzwerkkabeln in einem Rechenzentrum
Photo by Winston Chen on Unsplash

Cloudflare hat am 1. Oktober seine ersten selbst trainierten KI-Modelle veröffentlicht, und sie können etwas Ungewöhnliches nicht: Text schreiben. Clef und Clef-flash beantworten nur vorher festgelegte Fragen und liefern zu jeder erlaubten Antwort eine Wahrscheinlichkeit. Das klingt bescheiden, trifft aber genau die Stelle, an der viele KI-Agenten heute Zeit und Geld verlieren. Weil die Gewichte unter einer freien Lizenz offenliegen, kann jeder die Modelle herunterladen, selbst betreiben und anpassen.

Das Wichtigste in Kürze

  • Clef hat 27 Milliarden Parameter, Clef-flash 9 Milliarden; beide bauen auf Qwen-Modellen von Alibaba auf und stehen unter der Apache-2.0-Lizenz auf Hugging Face.
  • Statt Text liefern sie Wahrscheinlichkeiten für Ja/Nein-Fragen, Auswahlfragen und Bewertungsskalen, bis zu 64 Fragen und 4 Bilder pro Anfrage.
  • Laut Cloudflare liegt die mittlere Antwortzeit bei 209 Millisekunden für Clef und 39 Millisekunden für Clef-flash; bei 7 von 10 Klassifikationstests liegt Clef vorn.
  • Bei Wissens- und Denkaufgaben ist das Vorbild Jev des Start-ups TypeSafe deutlich stärker, und Jev ist pro Token günstiger.
  • Für Entwickler lohnt sich Clef vor allem dort, wo Agenten ständig kleine Entscheidungen treffen: Anfragen sortieren, Inhalte prüfen, Bots erkennen.

Was ein Entscheidungsmodell anders macht

Ein großes Sprachmodell wie Claude oder GPT erzeugt seine Antwort Wort für Wort. Will ein Programm nur wissen, ob ein Support-Ticket dringend ist oder an welches Team es gehen soll, ist das umständlich: Das Modell schreibt einen Satz, das Programm muss ihn auswerten, und dieselbe Frage kann beim zweiten Mal anders beantwortet werden. Entscheidungsmodelle drehen das um. Der Entwickler übergibt einen Zustand, etwa den Text eines Tickets, ein JSON-Objekt oder ein Bild, und dazu ein Schema typisierter Fragen. Zurück kommt für jede zulässige Antwort eine Zahl zwischen null und eins.

Clef kennt drei Fragetypen: Ja/Nein-Fragen mit der Wahrscheinlichkeit für Ja, Auswahlfragen mit einer Wahrscheinlichkeit pro Option und Bewertungen auf einer geordneten Skala. Technisch liest das zugrunde liegende Qwen-Modell Zustand und Fragen in einem einzigen Durchgang, ohne einen Token zu erzeugen. Ein kleiner zusätzlicher Transformer, den Cloudflare Joint Schema Head nennt, rechnet daraus die Antwortwahrscheinlichkeiten. Das erklärt das Tempo: Der langsamste Teil eines Sprachmodells, das schrittweise Schreiben, fällt weg.

Die Idee stammt nicht von Cloudflare. Das Start-up TypeSafe AI aus San Francisco hat Mitte September mit Jev ein solches Modell vorgestellt und die Kategorie System-One-Modelle getauft, in Anlehnung an Daniel Kahnemans schnelles, intuitives Denksystem. Auch das Trainingsverfahren, das die Wahrscheinlichkeiten verlässlich machen soll, übernimmt Cloudflare dem Namen nach: Reinforcement Learning for Calibrated Decisions. Clef ist ausdrücklich mit der Programmierschnittstelle von Jev kompatibel, wer Jev bereits nutzt, kann also ohne Umbau vergleichen. OpenAI hat auf seinem DevDay ebenfalls eine Decisions-API auf Basis von GPT-6 Luna in begrenzter Vorschau angekündigt, Preise und Details dazu sind bislang nicht veröffentlicht.

Die Zahlen: schnell beim Sortieren, schwach beim Wissen

Cloudflare vergleicht Clef auf zehn Klassifikationstests mit Jev und weiteren Modellen. Clef liegt bei sieben davon vorn. Beim Test BANKING77, der Bankanfragen 77 Kategorien zuordnet, erreicht es einen Macro-F1-Wert von 94,20, Jev kommt auf 79,74. Der Wert misst, wie treffsicher ein Modell über alle Kategorien hinweg einordnet. Beim Test CLINC150, der auch erkennen muss, wenn eine Anfrage in keine Kategorie passt, steht es 97,43 zu 89,27. Die mittlere Antwortzeit gibt Cloudflare mit 209,3 Millisekunden für Clef, 38,8 Millisekunden für Clef-flash und 524,1 Millisekunden für Jev an.

Ebenso aufschlussreich ist, wo Clef verliert. Bei Aufgaben, die Fachwissen und mehrstufiges Denken verlangen, liegt Jev weit vorn: im Wissenstest MMLU-Pro mit 82,7 zu 65,9 Punkten, im naturwissenschaftlichen Test GPQA Diamond mit 78,3 zu 48,0. Clef ist also ein Sortierer, kein Denker. Wer eine Entscheidung treffen muss, die Expertenwissen voraussetzt, ist mit einem großen Sprachmodell weiter besser bedient.

Herstellerzahlen sind das eine. Der Entwickler Flavio Copes hat die Modelle am Starttag selbst ausprobiert und von Italien aus mittlere Antwortzeiten von 191 bis 205 Millisekunden für Clef-flash und 524 bis 726 Millisekunden für Clef gemessen, inklusive Netzwerkweg. Anfragen mit Bildern brauchten bei ihm zwischen 13 und 30 Sekunden, große Bilder musste er vorher verkleinern. Das relativiert die Laborwerte, ändert aber wenig am Grundbefund: Für Text-Klassifikation ist Clef-flash schnell genug, um in fast jeden Arbeitsablauf eingebaut zu werden.

Was Clef kostet und für wen es sich lohnt

Auf Cloudflares Plattform Workers AI kostet Clef 0,24 Dollar je Million Eingabetoken, Clef-flash 0,09 Dollar. Jev ist mit 0,042 Dollar deutlich günstiger. Copes hat das an einem Beispiel durchgerechnet: 100.000 Ticket-Klassifikationen kosten mit Jev rund 1,68 Dollar, mit Clef rund 9,60 Dollar. In beiden Fällen sind das Kleinstbeträge im Vergleich zu dem, was dieselbe Arbeit mit einem großen Sprachmodell kostet. Gerade bei Agenten, die viele Zwischenschritte prüfen, summiert sich das schnell, wie der hohe Token-Verbrauch moderner Spitzenmodelle zeigt, den wir bei Gemini 4 Argon beschrieben haben.

Den eigentlichen Unterschied macht die Lizenz. Jev und OpenAIs Decisions-API laufen nur als Dienst beim Anbieter. Clef dagegen steht unter Apache 2.0, einer Lizenz, die auch kommerzielle Nutzung und Veränderungen erlaubt. Wer sensible Daten nicht an einen Cloud-Dienst schicken darf, etwa Kundenanfragen oder interne Dokumente, kann die Modelle im eigenen Rechenzentrum betreiben. Cloudflare hat sie auf einer einzelnen Nvidia-H200-Karte getestet. Rechnerisch belegen allein die Gewichte von Clef in 16-Bit-Genauigkeit rund 54 Gigabyte, die von Clef-flash rund 18 Gigabyte. Damit ist die kleine Variante auch für gut ausgestattete Workstations interessant, ein Fall für den Laptop ist sie nicht.

Cloudflare selbst nennt Einsätze aus dem eigenen Haus: Das Threat-Intelligence-Team ordnet Webseiten Kategorien zu und erkennt dabei Phishing, der Support leitet Anfragen nach Dringlichkeit an das passende Team, und Clef hilft, harmlose Crawler von bösartigen Bots zu unterscheiden. In einem Arbeitsablauf zur Domain-Klassifikation brauchte Clef nach Cloudflares Angaben 2,2 Sekunden, das offene Sprachmodell GPT-OSS-120B 4,7 Sekunden. Weil Clef auch Bilder liest, lassen sich etwa Screenshots vor der Veröffentlichung darauf prüfen, ob Passwörter oder Zugangsschlüssel lesbar sind. Wie wichtig solche automatischen Kontrollinstanzen für Agenten werden, zeigt auch Nvidias Ansatz mit OpenShell und Sentry.

So lässt sich Clef ausprobieren

Am schnellsten geht es über Workers AI: Die Modelle heißen dort @cf/cloudflare/clef und @cf/cloudflare/clef-flash und lassen sich aus einem Cloudflare Worker oder über die REST-Schnittstelle aufrufen. Wer selbst hosten will, findet die Gewichte unter cloudflare/clef und cloudflare/clef-flash auf Hugging Face, lauffähig mit PyTorch und der Transformers-Bibliothek. Ein guter erster Versuch ist eine Aufgabe, die heute ein Sprachmodell mit einem langen Prompt erledigt, etwa das Sortieren eingehender E-Mails: drei Fragen als Schema definieren, ein paar hundert echte Beispiele durchlaufen lassen und die Wahrscheinlichkeiten mit den bisherigen Ergebnissen vergleichen. Liegt die Sicherheit einer Antwort unter einer selbst gesetzten Schwelle, kann das Programm den Fall an ein größeres Modell oder einen Menschen weiterreichen. Genau dafür sind kalibrierte Wahrscheinlichkeiten nützlicher als ein frei formulierter Satz.

Für Firmen mit eigenen Daten kündigt Cloudflare zusätzlich einen Dienst an, mit dem sich Clef per Reinforcement Learning, also Training durch Belohnung, auf die eigene Aufgabe zuschneiden lässt. Zunächst arbeitet Cloudflare dabei mit ausgewählten Design-Partnern zusammen, eine Selbstbedienungsplattform soll später folgen. Cloudflare weist selbst darauf hin, dass ein solches Feintuning die allgemeinen Fähigkeiten zugunsten der Spezialaufgabe schwächen kann.

Ausblick: Die kleinen Modelle übernehmen die Routine

Clef ist kein Konkurrent für Claude, GPT oder Gemini, sondern ein Baustein darunter. Agenten bestehen zu einem großen Teil aus Routineentscheidungen: Ist diese Mail relevant, braucht diese Anfrage einen Menschen, darf dieser Schritt ohne Rückfrage laufen? Bisher beantwortet häufig dasselbe teure Sprachmodell diese Fragen, das auch die eigentliche Arbeit erledigt. Dass binnen gut zwei Wochen ein Start-up, OpenAI und Cloudflare auf denselben Gedanken kommen, spricht dafür, dass sich hier eine eigene Modellklasse bildet. Cloudflares Beitrag ist die Offenheit: Wer Entscheidungen seiner Agenten nachvollziehbar, schnell und auf eigener Hardware treffen lassen will, hat mit Clef jetzt erstmals ein frei nutzbares Werkzeug dafür. Ob die Wahrscheinlichkeiten in der Praxis so verlässlich sind, wie Cloudflare verspricht, wird sich an echten Daten zeigen, nicht an Benchmarks.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen