Alle Beiträge
Decision ModelsOpen SourceSelf-HostingAI Architecture

Cloudflare Clef: Entscheidungsmodelle für KI-Workflows – auch selbst hostbar

4 Min. LesezeitThomas Stermole
Cloudflare Clef bewertet vorgegebene Antwortmöglichkeiten für KI-Workflows und kann über Workers AI oder auf eigener Infrastruktur betrieben werden.

Cloudflare Clef ist eine Familie von KI-Entscheidungsmodellen, die Eingaben anhand vorgegebener Antwortmöglichkeiten bewerten. Das Ergebnis lässt sich direkt in einem Workflow weiterverarbeiten. Besonders interessant: Clef und Clef-flash sind auch für den Betrieb auf eigener Infrastruktur verfügbar.

Cloudflare hat die Modelle am 1. Oktober 2026 vorgestellt. Sie können über Workers AI genutzt oder von Hugging Face heruntergeladen werden. Damit gibt es sowohl einen verwalteten Dienst als auch die Möglichkeit zum Self-Hosting. Offizielle Ankündigung

Quellenstand: 5. Oktober 2026. Diese Vorstellung basiert auf Cloudflares Veröffentlichung, Dokumentation und Modellkarten. Sie enthält keinen eigenen Praxistest.

Was macht ein Entscheidungsmodell wie Clef?

Bei Clef geben Sie eine Situation, Fragen und erlaubte Antwortmöglichkeiten vor. Das Modell bewertet diese Optionen und liefert strukturierte Ergebnisse mit Modellwahrscheinlichkeiten. Freie Antworttexte müssen dafür nicht erzeugt und anschließend ausgewertet werden. Cloudflare-Dokumentation zur Einführung

Ein Beispiel: Eine Kundenanfrage beschreibt, dass im Onlineshop keine Bestellung mehr abgeschlossen werden kann. Ein Workflow könnte Clef fragen, welches Team zuständig ist und wie dringend die Anfrage behandelt werden sollte. Als mögliche Antworten werden etwa „Technik“, „Abrechnung“ und „Vertrieb“ sowie mehrere Dringlichkeitsstufen festgelegt.

Die Anwendung kann anhand der Bewertung ein Ticket zuordnen oder eine Prüfung anstoßen. Welche Aktion erlaubt ist, legt weiterhin der Workflow fest. Eine Modellwahrscheinlichkeit ist dabei keine Zusicherung, dass die Entscheidung fachlich richtig ist.

Clef und Clef-flash im Überblick

Cloudflare veröffentlicht zwei Varianten. Die Modellkarten beschreiben beide als multimodale Modelle: Sie können neben Text und JSON auch Bilder und Videoframes verarbeiten. Modellkarte Clef, Modellkarte Clef-flash

VarianteBasismodellPositionierung durch Cloudflare
ClefQwen3.8-27B, 27 Milliarden ParameterAnspruchsvollere Entscheidungen
Clef-flashQwen3.5-9B, 9 Milliarden ParameterAnwendungen mit besonders kurzen Reaktionszeiten

Die Schnittstelle ist laut Cloudflare mit Jev beziehungsweise SystemOne kompatibel. Unterstützt werden Ja/Nein-Fragen, die Auswahl aus benannten Optionen und Bewertungen anhand geordneter Antwortmöglichkeiten. Schnittstelle und Fragetypen

Wer das Grundprinzip näher kennenlernen möchte, findet ergänzende Beispiele im Artikel Jev erklärt: AI Decision Models.

Clef selbst hosten: Warum das attraktiv ist

Ja, Clef und Clef-flash lassen sich selbst hosten. Cloudflare stellt die Modellgewichte, den spezialisierten Entscheidungskopf und den benötigten Inferenzcode auf Hugging Face unter Apache 2.0 bereit. Der eigene Betrieb ist damit ausdrücklich vorgesehen. Clef: Dateien und Nutzung, Clef-flash: Dateien und Nutzung

Für Unternehmen eröffnet das eine zusätzliche Wahl beim Betriebsmodell. Die Entscheidungsverarbeitung kann in der eigenen Serverumgebung oder einer selbst verwalteten Private Cloud stattfinden. Ein Cloudflare-Modellendpunkt ist für diesen Betriebsweg nicht erforderlich.

Das ist vor allem interessant, wenn interne Informationen verarbeitet werden sollen oder das Unternehmen Infrastruktur, Zugriffe und Modellversionen selbst kontrollieren möchte. Die offen verfügbaren Gewichte verringern außerdem die Abhängigkeit von der Verfügbarkeit eines einzelnen gehosteten Dienstes.

Self-Hosting braucht allerdings eine passende Inferenzumgebung. Cloudflares Modellkarten dokumentieren den Einsatz mit PyTorch, Transformers und eigener Modellimplementierung. Eine einfache Installation in jeder lokalen LLM-App ist damit noch nicht belegt. Hardwarebedarf und Betriebsaufwand müssen für den konkreten Einsatz geprüft werden. Dokumentierter lokaler Betrieb

Welche Anwendungen sind denkbar?

Clef ist besonders dort interessant, wo eine Anwendung zwischen festgelegten Möglichkeiten wählen soll. Denkbare Aufgaben sind die Zuordnung von Supportanfragen, die Einordnung von Dokumenten oder die Auswahl eines nächsten Verarbeitungsschritts.

Bei einer Dokumentenprüfung könnte ein Workflow beispielsweise fragen, ob ein Bild ausreichend lesbar ist und welcher Dokumenttyp vorliegt. Die eigentliche Extraktion von Inhalten und die nachgelagerte Verarbeitung wären separate Schritte. Das sind mögliche Einsatzszenarien, keine von mir getesteten Ergebnisse.

Zwei Wege zum Einstieg

Für die Nutzung als verwalteter Dienst stehen Clef und Clef-flash auf Workers AI bereit. Für den eigenen Betrieb sind die offiziellen Hugging-Face-Repositories der Ausgangspunkt. Workers-AI-Einführung

Aus meiner Sicht macht gerade diese Wahl Clef interessant: Unternehmen können ein spezialisiertes Entscheidungsmodell nutzen und dessen Verarbeitung bei Bedarf auf eigener Infrastruktur betreiben. Wer bereits über lokale Entscheidungsmodelle nachdenkt, erhält damit eine weitere konkrete Option. Eine ergänzende Einordnung bietet der Artikel über lokale Jev-Alternativen.

Häufige Fragen zu Cloudflare Clef

Was ist Cloudflare Clef?

Clef ist eine Familie von KI-Entscheidungsmodellen von Cloudflare. Die Modelle bewerten eine Eingabe anhand vorgegebener Fragen und Antwortmöglichkeiten und liefern dazu strukturierte Ausgaben mit Modellwahrscheinlichkeiten.

Kann man Cloudflare Clef selbst hosten?

Ja. Cloudflare veröffentlicht Clef und Clef-flash samt Modellgewichten und Inferenzcode auf Hugging Face unter Apache 2.0. Damit ist ein Betrieb auf eigener Infrastruktur möglich; passende Hardware und eine eingerichtete Inferenzumgebung sind erforderlich.

Was unterscheidet Clef von Clef-flash?

Clef basiert auf einem Qwen-Modell mit 27 Milliarden Parametern, Clef-flash auf einem mit 9 Milliarden. Cloudflare positioniert Clef für anspruchsvollere Entscheidungen und Clef-flash für Anwendungen mit besonders kurzen Reaktionszeiten.

Offizielle Quellen

Nächster Schritt

Klingt relevant für Ihr Unternehmen?

In einem unverbindlichen Erstgespräch klären wir in 30 Minuten, ob und wo sich der Einstieg für Sie lohnt — ehrlich und ohne Verkaufsdruck.

Erstgespräch anfragen