Cloudflare Clef: Entscheidungsmodelle für KI-Workflows – auch selbst hostbar
Cloudflare Clef ist eine Familie von KI-Entscheidungsmodellen, die Eingaben anhand vorgegebener Antwortmöglichkeiten bewerten. Das Ergebnis lässt sich direkt in einem Workflow weiterverarbeiten. Besonders interessant: Clef und Clef-flash sind auch für den Betrieb auf eigener Infrastruktur verfügbar.
Cloudflare hat die Modelle am 1. Oktober 2026 vorgestellt. Sie können über Workers AI genutzt oder von Hugging Face heruntergeladen werden. Damit gibt es sowohl einen verwalteten Dienst als auch die Möglichkeit zum Self-Hosting. Offizielle Ankündigung
Quellenstand: 5. Oktober 2026. Diese Vorstellung basiert auf Cloudflares Veröffentlichung, Dokumentation und Modellkarten. Sie enthält keinen eigenen Praxistest.
Was macht ein Entscheidungsmodell wie Clef?
Bei Clef geben Sie eine Situation, Fragen und erlaubte Antwortmöglichkeiten vor. Das Modell bewertet diese Optionen und liefert strukturierte Ergebnisse mit Modellwahrscheinlichkeiten. Freie Antworttexte müssen dafür nicht erzeugt und anschließend ausgewertet werden. Cloudflare-Dokumentation zur Einführung
Ein Beispiel: Eine Kundenanfrage beschreibt, dass im Onlineshop keine Bestellung mehr abgeschlossen werden kann. Ein Workflow könnte Clef fragen, welches Team zuständig ist und wie dringend die Anfrage behandelt werden sollte. Als mögliche Antworten werden etwa „Technik“, „Abrechnung“ und „Vertrieb“ sowie mehrere Dringlichkeitsstufen festgelegt.
Die Anwendung kann anhand der Bewertung ein Ticket zuordnen oder eine Prüfung anstoßen. Welche Aktion erlaubt ist, legt weiterhin der Workflow fest. Eine Modellwahrscheinlichkeit ist dabei keine Zusicherung, dass die Entscheidung fachlich richtig ist.
Clef und Clef-flash im Überblick
Cloudflare veröffentlicht zwei Varianten. Die Modellkarten beschreiben beide als multimodale Modelle: Sie können neben Text und JSON auch Bilder und Videoframes verarbeiten. Modellkarte Clef, Modellkarte Clef-flash
| Variante | Basismodell | Positionierung durch Cloudflare |
|---|---|---|
| Clef | Qwen3.8-27B, 27 Milliarden Parameter | Anspruchsvollere Entscheidungen |
| Clef-flash | Qwen3.5-9B, 9 Milliarden Parameter | Anwendungen mit besonders kurzen Reaktionszeiten |
Die Schnittstelle ist laut Cloudflare mit Jev beziehungsweise SystemOne kompatibel. Unterstützt werden Ja/Nein-Fragen, die Auswahl aus benannten Optionen und Bewertungen anhand geordneter Antwortmöglichkeiten. Schnittstelle und Fragetypen
Wer das Grundprinzip näher kennenlernen möchte, findet ergänzende Beispiele im Artikel Jev erklärt: AI Decision Models.
Clef selbst hosten: Warum das attraktiv ist
Ja, Clef und Clef-flash lassen sich selbst hosten. Cloudflare stellt die Modellgewichte, den spezialisierten Entscheidungskopf und den benötigten Inferenzcode auf Hugging Face unter Apache 2.0 bereit. Der eigene Betrieb ist damit ausdrücklich vorgesehen. Clef: Dateien und Nutzung, Clef-flash: Dateien und Nutzung
Für Unternehmen eröffnet das eine zusätzliche Wahl beim Betriebsmodell. Die Entscheidungsverarbeitung kann in der eigenen Serverumgebung oder einer selbst verwalteten Private Cloud stattfinden. Ein Cloudflare-Modellendpunkt ist für diesen Betriebsweg nicht erforderlich.
Das ist vor allem interessant, wenn interne Informationen verarbeitet werden sollen oder das Unternehmen Infrastruktur, Zugriffe und Modellversionen selbst kontrollieren möchte. Die offen verfügbaren Gewichte verringern außerdem die Abhängigkeit von der Verfügbarkeit eines einzelnen gehosteten Dienstes.
Self-Hosting braucht allerdings eine passende Inferenzumgebung. Cloudflares Modellkarten dokumentieren den Einsatz mit PyTorch, Transformers und eigener Modellimplementierung. Eine einfache Installation in jeder lokalen LLM-App ist damit noch nicht belegt. Hardwarebedarf und Betriebsaufwand müssen für den konkreten Einsatz geprüft werden. Dokumentierter lokaler Betrieb
Welche Anwendungen sind denkbar?
Clef ist besonders dort interessant, wo eine Anwendung zwischen festgelegten Möglichkeiten wählen soll. Denkbare Aufgaben sind die Zuordnung von Supportanfragen, die Einordnung von Dokumenten oder die Auswahl eines nächsten Verarbeitungsschritts.
Bei einer Dokumentenprüfung könnte ein Workflow beispielsweise fragen, ob ein Bild ausreichend lesbar ist und welcher Dokumenttyp vorliegt. Die eigentliche Extraktion von Inhalten und die nachgelagerte Verarbeitung wären separate Schritte. Das sind mögliche Einsatzszenarien, keine von mir getesteten Ergebnisse.
Zwei Wege zum Einstieg
Für die Nutzung als verwalteter Dienst stehen Clef und Clef-flash auf Workers AI bereit. Für den eigenen Betrieb sind die offiziellen Hugging-Face-Repositories der Ausgangspunkt. Workers-AI-Einführung
Aus meiner Sicht macht gerade diese Wahl Clef interessant: Unternehmen können ein spezialisiertes Entscheidungsmodell nutzen und dessen Verarbeitung bei Bedarf auf eigener Infrastruktur betreiben. Wer bereits über lokale Entscheidungsmodelle nachdenkt, erhält damit eine weitere konkrete Option. Eine ergänzende Einordnung bietet der Artikel über lokale Jev-Alternativen.
Häufige Fragen zu Cloudflare Clef
Was ist Cloudflare Clef?
Clef ist eine Familie von KI-Entscheidungsmodellen von Cloudflare. Die Modelle bewerten eine Eingabe anhand vorgegebener Fragen und Antwortmöglichkeiten und liefern dazu strukturierte Ausgaben mit Modellwahrscheinlichkeiten.
Kann man Cloudflare Clef selbst hosten?
Ja. Cloudflare veröffentlicht Clef und Clef-flash samt Modellgewichten und Inferenzcode auf Hugging Face unter Apache 2.0. Damit ist ein Betrieb auf eigener Infrastruktur möglich; passende Hardware und eine eingerichtete Inferenzumgebung sind erforderlich.
Was unterscheidet Clef von Clef-flash?
Clef basiert auf einem Qwen-Modell mit 27 Milliarden Parametern, Clef-flash auf einem mit 9 Milliarden. Cloudflare positioniert Clef für anspruchsvollere Entscheidungen und Clef-flash für Anwendungen mit besonders kurzen Reaktionszeiten.