↓ Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
SPECIALIZED Cloudflare USA

Cloudflare Clef (Clef & Clef-flash)

Clef und Clef-flash sind Cloudflares erste selbst trainierte Modelle: offene, multimodale Entscheidungsmodelle (Apache 2.0, 27B und 9B Parameter auf Qwen-Basis), die typisierte Fragen mit Wahrscheinlichkeiten statt Text beantworten und zur Jev-API kompatibel sind. Auf Workers AI 0,24 bzw. 0,09 USD pro 1 Million Input-Token, Gewichte auf Hugging Face für Self-Hosting in der EU. Stand: 2. Oktober 2026.

Lizenz Apache 2.0
DSGVO-Hosting Verfügbar
Kontext 65536 Tokens
Modalität Text, JSON, Image, Video → Typisierte Entscheidungen (Choice, Score, Noul) mit Wahrscheinlichkeiten

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Clef (@cf/cloudflare/clef, 27B)
1. Oktober 2026
Erstes von Cloudflare selbst trainiertes Modell: 27B Parameter, post-trainiert auf eingefrorenem Qwen3.8-27B mit Vision-Encoder Multimodaler Zustand: Text, JSON, bis zu 4 Bilder (PNG, JPEG, WebP, je 4 MiB und 16 Megapixel) und Video; 65.536 Token Kontext, 1 bis 64 Fragen je Anfrage Laut Cloudflare-Benchmarks: BFCL 98,47, ToolRet nDCG@10 69,19, API-Bank 91,93, BANKING77 94,20 Macro-F1, CLINC150+OOS 97,43 Macro-F1 (Jev: 95,75 / 65,28 / 88,19 / 79,74 / 89,27) Jev-API-kompatibel (Fragetypen noul, choice, score, gleiches Antwortformat); nicht-autoregressiv, ein Logit je Option 0,24 USD pro 1 Million Input-Token auf Workers AI, Aufruf per Workers-Binding, REST /ai/run oder Cloudflare AI Gateway Apache 2.0 auf Hugging Face (Cloudflare/clef); Self-Hosting mit Transformers, vLLM, SGLang (OpenAI-kompatibel), Docker und systemone()-Funktion Trainiert mit label-geglätteter Kreuzentropie, Brier-Loss für Kalibrierung und RLCD als Zweitziel (laut Blog)
Mittlere Latenz 209,3 ms (p95 238,6 ms) auf H200 laut Cloudflare, rund fünfmal langsamer als Clef-flash Wissens-Benchmarks unter Jev: GPQA Diamond 48,0 gegenüber 78,3, MMLU-Pro 65,9 gegenüber 82,7 (Cloudflare-Tabelle) Self-Hosting braucht in BF16 rund 54 GB GPU-Speicher; Community-GGUF-Quantisierungen enthalten den Entscheidungskopf nicht, PyTorch nötig (unabhängiger Testbericht) Alle Vergleichswerte stammen von Cloudflare; unabhängige Evaluation bislang nur ein Einzeltest mit 42 Entscheidungen Keine dokumentierte Regionsbindung der Workers-AI-Inferenz; Sprachabdeckung in Modellkarte nicht ausgewiesen
Aktuell
Clef-flash (@cf/cloudflare/clef-flash, 9B)
1. Oktober 2026
9B Parameter auf Basis von Qwen3.5-9B mit Vision-Encoder; mittlere Latenz 38,8 ms, p95 122,4 ms auf H200 (Cloudflare), rund 13-mal schneller als Jev in derselben Messung 0,09 USD pro 1 Million Input-Token auf Workers AI; gleiche Eingaben und Limits wie Clef (65.536 Token, 64 Fragen, 4 Bilder, Video) Laut Cloudflare bei Werkzeug-Benchmarks auf Augenhöhe oder vor Clef: BFCL 98,76, API-Bank 93,11, BANKING77 90,93 Unabhängiger Einzeltest (42 Agenten-Entscheidungen): 66,7 % gegenüber 71,4 % für Jev, 83 % Übereinstimmung mit der API, lauffähig auf einer RTX 3090 Jev-API-kompatibel, Apache 2.0, Self-Hosting mit deutlich geringerem Speicherbedarf als Clef
CLINC150+OOS nur 66,77 Macro-F1 (Clef 97,43, Jev 89,27): Out-of-Scope-Erkennung deutlich schwächer (Cloudflare-Tabelle) GSM8K 67,3 gegenüber 80,8 für Clef laut Modellkarte; Triage-Aufgaben im Einzeltest mit größtem Abstand zu Jev (10 von 20 gegenüber 12 von 20) Modellkarte setzt beim Self-Hosting standardmäßig 16.384 Token Eingabelänge; 65.536 gelten auf Workers AI Vergleichswerte vom Hersteller, Sprachabdeckung nicht ausgewiesen
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Ticket- und Support-Triage mit Konfidenz
Klassifizierung von Webseiten, Domains und Bots (Cloudflare-Beispiele)
Trust-and-Safety-Prüfungen von Einreichungen
Entscheidungsknoten und Supervision in KI-Agenten
Bild- und Videoklassifizierung mit typisierten Antworten
Routing vor teuren Reasoning-Modellen

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public auf Cloudflare Workers AI (Binding env.AI.run, REST /ai/run, AI Gateway); Gewichte auf Hugging Face für Self-Hosting (Transformers, vLLM, SGLang, Docker)
Latenz (TTFT) 209,3 ms (Clef) bzw. 38,8 ms (Clef-flash) im Median auf H200 (Cloudflare-Messung)
Features & Capabilities
Structured Output Vision
Training & Wissen
Wissensstand nicht dokumentiert (Backbones Qwen3.8-27B und Qwen3.5-9B)
Fine-Tuning Verfügbar (RL-Fine-Tuning-Plattform von Cloudflare (begleitet durch Forward-Deployed-Engineers, Self-Service angekündigt), Eigenes Fine-Tuning der offenen Gewichte)
Sprachunterstützung
Beste Qualität Englisch
Unterstützt Nicht ausgewiesen; Qwen-Backbones sind mehrsprachig, Cloudflare veröffentlicht keine Sprachauswertung
Benchmarks von Cloudflare sind englischsprachig; für Deutsch eigene Evaluation vor dem Einsatz empfohlen

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene EU-Infrastruktur oder EU-Cloud
Empfohlen für EU-Residenz: Apache-2.0-Gewichte, vLLM/SGLang/Transformers, Clef rund 54 GB GPU-Speicher in BF16
Cloudflare Workers AI
Globales Cloudflare-Netz
Kein Lesen, Speichern oder Training mit Kundenanfragen laut Cloudflare; keine dokumentierte Regionsbindung der Inferenz in der Data Localization Suite (Stand 2. Oktober 2026)
Lizenz & Hosting
Lizenz Apache 2.0
Sicherheitsfilter Keine (Entscheidungsmodell ohne Textgenerierung)
Enterprise Support Ja
On-Premise

Benchmarks

Leistungsvergleich mit standardisierten Tests

BFCL case exact (Clef, Cloudflare-Angabe)
98.47
BANKING77 Macro-F1 (Clef, Cloudflare-Angabe)
94.2
CLINC150+OOS Macro-F1 (Clef, Cloudflare-Angabe)
97.43
API-Bank Genauigkeit (Clef-flash, Cloudflare-Angabe)
93.11
MMLU-Pro (Clef, Cloudflare-Angabe)
65.9

innFactory AI Consulting aus Rosenheim nimmt Clef auf, weil Cloudflare damit die Kategorie der System-One-Modelle, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben, um ein offenes, multimodales und gehostetes Angebot erweitert. Grundlage dieser Seite sind der Ankündigungsbeitrag im Cloudflare-Blog, der Workers-AI-Changelog, die Modellseiten für Clef und Clef-flash, die Workers-AI-Preisliste sowie die Modellkarten auf Hugging Face. Stand: 2. Oktober 2026.

Was ist Clef?

Am 1. Oktober 2026 hat Cloudflare mit Clef und Clef-flash die ersten Modelle veröffentlicht, die das Unternehmen selbst trainiert hat. Beide sind Entscheidungsmodelle: Sie nehmen einen Zustand entgegen (einen Support-Fall, eine Webseite, einen Agenten-Trace, ein Bild) sowie eine Liste typisierter Fragen und geben für jede Frage Wahrscheinlichkeiten über vordefinierte Antworten zurück. Text erzeugen sie nicht. Die Fragetypen sind dieselben wie bei Jev: noul (Ja/Nein als Wahrscheinlichkeit), choice (eine Option aus einer Liste mit Wahrscheinlichkeit je Option) und score (Stufe auf einer Rubrik). Cloudflare bezeichnet die Modelle als vollständig kompatibel zur Jev-API.

ClefClef-flash
Workers-AI-ID@cf/cloudflare/clef@cf/cloudflare/clef-flash
BasisQwen3.8-27B (eingefroren) mit Vision-EncoderQwen3.5-9B (eingefroren) mit Vision-Encoder
Parameter27 Milliarden9 Milliarden
Kontext (Workers AI)65.536 Token65.536 Token
Preis (Workers AI)0,24 USD pro 1M Input-Token0,09 USD pro 1M Input-Token
Mittlere Latenz (Cloudflare, H200)209,3 ms38,8 ms
LizenzApache 2.0Apache 2.0

Technisch sitzt auf dem eingefrorenen Qwen-Backbone ein gemeinsamer Schema-Kopf, ein kleiner Transformer, der die Evidenz aus dem Zustand den Fragen zuordnet und pro Option genau ein Logit ausgibt. Trainiert wurde laut Blog mit label-geglätteter Kreuzentropie, einem Brier-Loss für die Kalibrierung und Reinforcement Learning for Calibrated Decisions (RLCD) als Zweitziel.

Eingaben und Limits auf Workers AI

  • Zustand: Text, JSON-Objekte oder -Arrays, bis zu 4 Bilder (PNG, JPEG, WebP, je maximal 4 MiB und 16 Megapixel) sowie Video; Anfragekörper maximal 13 MiB, dekodierte Bilddaten maximal 8 MiB.
  • Fragen: 1 bis 64 je Anfrage, Fragen-IDs bis 100 Zeichen.
  • Antwort: Modellkennung, answers mit denselben Schlüsseln wie die Fragen und usage.
  • Aufruf: Workers-Binding env.AI.run(), REST-Endpunkt /ai/run oder über das Cloudflare AI Gateway; Beispiele für TypeScript, Python und cURL in der Doku.
  • Abrechnung: Workers AI rechnet in Neurons ab (Clef 21.818, Clef-flash 8.182 Neurons je 1 Million Input-Token); 10.000 Neurons pro Tag sind kostenlos, darüber 0,011 USD je 1.000 Neurons im Workers-Paid-Plan. Ein Output-Preis ist nicht gelistet.

Benchmarks: Cloudflares Angaben

Cloudflare veröffentlicht im Blog eine Tabelle gegen Jev; laut Changelog führt Clef bei 7 von 10 Entscheidungs-Benchmarks. Es sind Herstellerangaben.

BenchmarkClefClef-flashJev (laut Cloudflare)
BFCL, case exact98,4798,7695,75
ToolRet, nDCG@1069,1966,4365,28
API-Bank, Genauigkeit91,9393,1188,19
BANKING77, Macro-F194,2090,9379,74
CLINC150+OOS, Macro-F197,4366,7789,27
GPQA Diamond (Wissen)48,051,078,3
MMLU-Pro (Wissen)65,965,382,7

Zwei Dinge fallen auf. Erstens liegt Jev bei den Wissens-Benchmarks klar vorn, Clef bei den Werkzeug- und Intent-Aufgaben. Zweitens bricht Clef-flash bei CLINC150 mit Out-of-Scope-Erkennung ein (66,77 gegenüber 97,43 für Clef). Wer Clef-flash wegen der Latenz wählt, sollte Out-of-Scope-Fälle gesondert testen.

In den von TypeSafe veröffentlichten Workflow-Evaluationen (Rechnungsverarbeitung, Kundenservice, Sicherheitsvorfälle) liegen alle drei Modelle laut Cloudflare nahe beieinander: 64,7 / 57,1 / 61,8 bei Rechnungen, 76,3 / 77,0 / 76,0 im Kundenservice, 62,9 / 61,7 / 61,7 bei Vorfällen (Clef / Clef-flash / Jev).

Latenz (Cloudflare-Messung auf H200): Clef 209,3 ms im Median und 238,6 ms p95, Clef-flash 38,8 ms und 122,4 ms, Jev 524,1 ms und 536,0 ms. In derselben Tabelle führt Cloudflare Laya mit 5,8 ms im Median, aber 222,5 ms p95.

Unabhängiger Einzeltest: Ein Entwickler hat Clef-flash lokal auf einer RTX 3090 gegen die Jev-API an 42 Entscheidungen eines autonomen Agenten verglichen: Jev 71,4 %, Clef-flash 66,7 %, in 83 % der Fälle dieselbe Entscheidung; bei Computer-Use-Aktionen und Supervision identisch, bei Triage 10 statt 12 von 20 Treffern. Der Test ist nicht peer-reviewed und klein, zeigt aber die Größenordnung. Praktischer Hinweis daraus: Community-GGUF-Quantisierungen enthalten den Entscheidungskopf nicht, für die volle Funktion ist PyTorch nötig; Clef (27B) braucht in BF16 rund 54 GB GPU-Speicher.

Datenschutz, Regionen und Self-Hosting

Für die gehostete Variante gilt laut Cloudflare: Anfragen und Antworten werden weder gelesen, gespeichert noch zum Training genutzt, es sei denn, der Kunde nutzt das Fine-Tuning-Angebot. Die Workers-AI-Datennutzungsdoku bestätigt, dass Kundeninhalte nicht zum Training von Modellen oder zur Verbesserung von Diensten verwendet werden. Workers AI läuft im globalen Cloudflare-Netz; die Dokumentation der Data Localization Suite nennt Workers AI nicht als Produkt mit Regionsbindung (Stand 2. Oktober 2026). Wer eine vertragliche Zusage zur Verarbeitung in der EU braucht, sollte das mit Cloudflare klären oder den zweiten Weg gehen.

Der zweite Weg ist Self-Hosting: Die Gewichte beider Modelle stehen unter Apache 2.0 auf Hugging Face (Cloudflare/clef, Cloudflare/clef-flash). Die Modellkarte beschreibt den Betrieb mit Transformers, vLLM und SGLang (OpenAI-kompatible APIs), per Docker sowie eine systemone()-Funktion für die Jev-kompatible Schnittstelle; getestet hat Cloudflare auf einer einzelnen H200 in BF16. Damit lässt sich Clef auf eigener Infrastruktur oder bei einem EU-Cloud-Anbieter betreiben, mit voller Datenkontrolle.

RL-Fine-Tuning-Plattform

Gemeinsam mit Clef hat Cloudflare eine Plattform für Reinforcement-Learning-Fine-Tuning angekündigt. Die Bausteine: das AI Gateway erfasst Produktionsdaten, Workers AI erzeugt Rollouts, Cloudflare Containers dienen als RL-Sandbox, ein neuer Trainer aktualisiert die Gewichte, und das Ergebnis wird über Workers AI mit eigenem Modell wieder bereitgestellt. Zum Start ist das ein begleitetes Angebot mit Cloudflares Forward-Deployed-Engineers über ein Design-Partner-Formular; eine Self-Service-Variante ist angekündigt, Preise sind nicht veröffentlicht.

Einordnung: Clef, Jev und Laya

Clef / Clef-flashJevLaya
LizenzApache 2.0, Open Weightsproprietäre APIApache 2.0, Open Weights
BetriebWorkers AI oder Self-Hostingnur API (USA)nur Self-Hosting
Größe27B / 9B (Qwen-Basis)nicht veröffentlicht0,3 bis 0,4B (Encoder)
EingabenText, JSON, Bilder, VideoText, JSONText, JSON
Kontext65.536 Token64.000 Token kombiniert512 bis 1.024 Token, Fenster bis 8.192
Preis gehostet0,24 / 0,09 USD pro 1M Input0,042 USD pro 1M Inputkeine gehostete API
EU-Residenzper Self-Hostingnicht dokumentiertper Self-Hosting

Clef schließt die Lücke zwischen Jev (stark, aber geschlossen und US-gehostet) und Laya (offen, aber klein): ein offenes Modell mit Backbone in LLM-Größe, Bild- und Videoeingabe und einer gehosteten Option mit Preis. Der Preis liegt über Jev, die Latenz von Clef-flash darunter. Kein Modell der drei ersetzt ein LLM; für Text, Zusammenfassungen und Code bleiben Modelle wie Qwen, Mistral oder GPT-OSS zuständig.

Unsere Empfehlung

Für Unternehmen im DACH-Raum ist Clef vor allem als selbst gehostetes Entscheidungsmodell interessant: offene Lizenz, Jev-kompatible Schnittstelle, Bild- und Videoeingabe, und mit Clef-flash eine Variante, die auf einer einzelnen GPU läuft. Prüfen Sie vor dem Einsatz drei Punkte: Out-of-Scope-Erkennung bei Clef-flash, die Sprachqualität auf deutschen Daten (Cloudflare veröffentlicht nur englische Benchmarks) und beim gehosteten Betrieb die Vertragslage zur Verarbeitungsregion. Als Vorstufe zu Sprachmodellen in CompanyGPT oder als Router im AI Gateway prüfen wir den Einsatz projektbezogen. Für eine Einschätzung, ob ein Entscheidungsmodell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Häufig gestellte Fragen

Was ist Cloudflare Clef?

Clef ist ein am 1. Oktober 2026 veröffentlichtes Entscheidungsmodell von Cloudflare, das erste Modell, das Cloudflare selbst trainiert hat. Es nimmt einen Zustand (Text, JSON, Bilder oder Video) und eine Liste typisierter Fragen entgegen und gibt für jede Frage Wahrscheinlichkeiten über vordefinierte Antworten zurück, ohne Text zu erzeugen. Clef hat 27 Milliarden Parameter auf Basis von Qwen3.8-27B, Clef-flash 9 Milliarden auf Basis von Qwen3.5-9B. Beide stehen unter Apache 2.0 auf Hugging Face und laufen gehostet auf Cloudflare Workers AI.

Was unterscheidet Clef und Clef-flash?

Clef (27B) ist das genauere Modell, Clef-flash (9B) das schnellere: Cloudflare misst auf einer H200 eine mittlere Latenz von 209,3 ms für Clef und 38,8 ms für Clef-flash. Auf Workers AI kostet Clef 0,24 USD und Clef-flash 0,09 USD pro 1 Million Input-Token. In Cloudflares Benchmarks liegen beide bei Werkzeug- und Intent-Aufgaben nahe beieinander; bei CLINC150 mit Out-of-Scope-Erkennung fällt Clef-flash mit 66,77 gegenüber 97,43 Macro-F1 für Clef deutlich ab.

Was kostet Clef auf Workers AI?

Die Workers-AI-Preisliste (Stand 2. Oktober 2026) nennt 0,24 USD pro 1 Million Input-Token für Clef (21.818 Neurons) und 0,09 USD für Clef-flash (8.182 Neurons); ein Output-Preis ist nicht gelistet. Workers AI rechnet in Neurons ab, 10.000 Neurons pro Tag sind kostenlos, darüber kostet es 0,011 USD je 1.000 Neurons im Workers-Paid-Plan.

Ist Clef DSGVO-konform nutzbar?

Zwei Wege: Gehostet auf Workers AI läuft Clef auf Cloudflares globalem Netz; Cloudflare erklärt, Anfragen und Antworten weder zu lesen, zu speichern noch zum Training zu nutzen, dokumentiert in der Data Localization Suite aber keine Regionsbindung für Workers-AI-Inferenz (Stand 2. Oktober 2026). Wer die Verarbeitung in der EU halten muss, betreibt die Apache-2.0-Gewichte selbst, etwa per vLLM auf eigener Infrastruktur oder bei einem EU-Cloud-Anbieter; Clef braucht dafür in BF16 rund 54 GB GPU-Speicher, Clef-flash deutlich weniger.

Wie schneidet Clef gegen Jev ab?

Laut Cloudflares eigenen Messungen führt Clef bei 7 von 10 Entscheidungs-Benchmarks, etwa BANKING77 (94,20 gegenüber 79,74 Macro-F1) und BFCL (98,47 gegenüber 95,75). Bei Wissens-Benchmarks liegt Jev laut derselben Tabelle vorn (GPQA Diamond 78,3 gegenüber 48,0; MMLU-Pro 82,7 gegenüber 65,9). Ein unabhängiger Einzeltest mit 42 Agenten-Entscheidungen sah Jev bei 71,4 Prozent und Clef-flash bei 66,7 Prozent mit 83 Prozent Übereinstimmung. Clef ist zur Jev-API kompatibel, bestehende Integrationen können die Basis-URL umstellen.

Was ist Cloudflares RL-Fine-Tuning-Plattform?

Zusammen mit Clef hat Cloudflare eine Plattform für Reinforcement-Learning-Fine-Tuning angekündigt: AI Gateway erfasst Daten, Workers AI erzeugt Rollouts, Cloudflare Containers dienen als Sandbox, ein neuer Trainer aktualisiert die Gewichte, das Ergebnis wird über Workers AI mit eigenem Modell wieder bereitgestellt. Zum Start läuft das als begleitetes Angebot mit Cloudflares Forward-Deployed-Engineers, eine Self-Service-Variante ist angekündigt, Preise sind nicht veröffentlicht.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.