innFactory AI Consulting aus Rosenheim nimmt Clef auf, weil Cloudflare damit die Kategorie der System-One-Modelle, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben, um ein offenes, multimodales und gehostetes Angebot erweitert. Grundlage dieser Seite sind der Ankündigungsbeitrag im Cloudflare-Blog, der Workers-AI-Changelog, die Modellseiten für Clef und Clef-flash, die Workers-AI-Preisliste sowie die Modellkarten auf Hugging Face. Stand: 2. Oktober 2026.
Was ist Clef?
Am 1. Oktober 2026 hat Cloudflare mit Clef und Clef-flash die ersten Modelle veröffentlicht, die das Unternehmen selbst trainiert hat. Beide sind Entscheidungsmodelle: Sie nehmen einen Zustand entgegen (einen Support-Fall, eine Webseite, einen Agenten-Trace, ein Bild) sowie eine Liste typisierter Fragen und geben für jede Frage Wahrscheinlichkeiten über vordefinierte Antworten zurück. Text erzeugen sie nicht. Die Fragetypen sind dieselben wie bei Jev: noul (Ja/Nein als Wahrscheinlichkeit), choice (eine Option aus einer Liste mit Wahrscheinlichkeit je Option) und score (Stufe auf einer Rubrik). Cloudflare bezeichnet die Modelle als vollständig kompatibel zur Jev-API.
| Clef | Clef-flash | |
|---|---|---|
| Workers-AI-ID | @cf/cloudflare/clef | @cf/cloudflare/clef-flash |
| Basis | Qwen3.8-27B (eingefroren) mit Vision-Encoder | Qwen3.5-9B (eingefroren) mit Vision-Encoder |
| Parameter | 27 Milliarden | 9 Milliarden |
| Kontext (Workers AI) | 65.536 Token | 65.536 Token |
| Preis (Workers AI) | 0,24 USD pro 1M Input-Token | 0,09 USD pro 1M Input-Token |
| Mittlere Latenz (Cloudflare, H200) | 209,3 ms | 38,8 ms |
| Lizenz | Apache 2.0 | Apache 2.0 |
Technisch sitzt auf dem eingefrorenen Qwen-Backbone ein gemeinsamer Schema-Kopf, ein kleiner Transformer, der die Evidenz aus dem Zustand den Fragen zuordnet und pro Option genau ein Logit ausgibt. Trainiert wurde laut Blog mit label-geglätteter Kreuzentropie, einem Brier-Loss für die Kalibrierung und Reinforcement Learning for Calibrated Decisions (RLCD) als Zweitziel.
Eingaben und Limits auf Workers AI
- Zustand: Text, JSON-Objekte oder -Arrays, bis zu 4 Bilder (PNG, JPEG, WebP, je maximal 4 MiB und 16 Megapixel) sowie Video; Anfragekörper maximal 13 MiB, dekodierte Bilddaten maximal 8 MiB.
- Fragen: 1 bis 64 je Anfrage, Fragen-IDs bis 100 Zeichen.
- Antwort: Modellkennung,
answersmit denselben Schlüsseln wie die Fragen undusage. - Aufruf: Workers-Binding
env.AI.run(), REST-Endpunkt/ai/runoder über das Cloudflare AI Gateway; Beispiele für TypeScript, Python und cURL in der Doku. - Abrechnung: Workers AI rechnet in Neurons ab (Clef 21.818, Clef-flash 8.182 Neurons je 1 Million Input-Token); 10.000 Neurons pro Tag sind kostenlos, darüber 0,011 USD je 1.000 Neurons im Workers-Paid-Plan. Ein Output-Preis ist nicht gelistet.
Benchmarks: Cloudflares Angaben
Cloudflare veröffentlicht im Blog eine Tabelle gegen Jev; laut Changelog führt Clef bei 7 von 10 Entscheidungs-Benchmarks. Es sind Herstellerangaben.
| Benchmark | Clef | Clef-flash | Jev (laut Cloudflare) |
|---|---|---|---|
| BFCL, case exact | 98,47 | 98,76 | 95,75 |
| ToolRet, nDCG@10 | 69,19 | 66,43 | 65,28 |
| API-Bank, Genauigkeit | 91,93 | 93,11 | 88,19 |
| BANKING77, Macro-F1 | 94,20 | 90,93 | 79,74 |
| CLINC150+OOS, Macro-F1 | 97,43 | 66,77 | 89,27 |
| GPQA Diamond (Wissen) | 48,0 | 51,0 | 78,3 |
| MMLU-Pro (Wissen) | 65,9 | 65,3 | 82,7 |
Zwei Dinge fallen auf. Erstens liegt Jev bei den Wissens-Benchmarks klar vorn, Clef bei den Werkzeug- und Intent-Aufgaben. Zweitens bricht Clef-flash bei CLINC150 mit Out-of-Scope-Erkennung ein (66,77 gegenüber 97,43 für Clef). Wer Clef-flash wegen der Latenz wählt, sollte Out-of-Scope-Fälle gesondert testen.
In den von TypeSafe veröffentlichten Workflow-Evaluationen (Rechnungsverarbeitung, Kundenservice, Sicherheitsvorfälle) liegen alle drei Modelle laut Cloudflare nahe beieinander: 64,7 / 57,1 / 61,8 bei Rechnungen, 76,3 / 77,0 / 76,0 im Kundenservice, 62,9 / 61,7 / 61,7 bei Vorfällen (Clef / Clef-flash / Jev).
Latenz (Cloudflare-Messung auf H200): Clef 209,3 ms im Median und 238,6 ms p95, Clef-flash 38,8 ms und 122,4 ms, Jev 524,1 ms und 536,0 ms. In derselben Tabelle führt Cloudflare Laya mit 5,8 ms im Median, aber 222,5 ms p95.
Unabhängiger Einzeltest: Ein Entwickler hat Clef-flash lokal auf einer RTX 3090 gegen die Jev-API an 42 Entscheidungen eines autonomen Agenten verglichen: Jev 71,4 %, Clef-flash 66,7 %, in 83 % der Fälle dieselbe Entscheidung; bei Computer-Use-Aktionen und Supervision identisch, bei Triage 10 statt 12 von 20 Treffern. Der Test ist nicht peer-reviewed und klein, zeigt aber die Größenordnung. Praktischer Hinweis daraus: Community-GGUF-Quantisierungen enthalten den Entscheidungskopf nicht, für die volle Funktion ist PyTorch nötig; Clef (27B) braucht in BF16 rund 54 GB GPU-Speicher.
Datenschutz, Regionen und Self-Hosting
Für die gehostete Variante gilt laut Cloudflare: Anfragen und Antworten werden weder gelesen, gespeichert noch zum Training genutzt, es sei denn, der Kunde nutzt das Fine-Tuning-Angebot. Die Workers-AI-Datennutzungsdoku bestätigt, dass Kundeninhalte nicht zum Training von Modellen oder zur Verbesserung von Diensten verwendet werden. Workers AI läuft im globalen Cloudflare-Netz; die Dokumentation der Data Localization Suite nennt Workers AI nicht als Produkt mit Regionsbindung (Stand 2. Oktober 2026). Wer eine vertragliche Zusage zur Verarbeitung in der EU braucht, sollte das mit Cloudflare klären oder den zweiten Weg gehen.
Der zweite Weg ist Self-Hosting: Die Gewichte beider Modelle stehen unter Apache 2.0 auf Hugging Face (Cloudflare/clef, Cloudflare/clef-flash). Die Modellkarte beschreibt den Betrieb mit Transformers, vLLM und SGLang (OpenAI-kompatible APIs), per Docker sowie eine systemone()-Funktion für die Jev-kompatible Schnittstelle; getestet hat Cloudflare auf einer einzelnen H200 in BF16. Damit lässt sich Clef auf eigener Infrastruktur oder bei einem EU-Cloud-Anbieter betreiben, mit voller Datenkontrolle.
RL-Fine-Tuning-Plattform
Gemeinsam mit Clef hat Cloudflare eine Plattform für Reinforcement-Learning-Fine-Tuning angekündigt. Die Bausteine: das AI Gateway erfasst Produktionsdaten, Workers AI erzeugt Rollouts, Cloudflare Containers dienen als RL-Sandbox, ein neuer Trainer aktualisiert die Gewichte, und das Ergebnis wird über Workers AI mit eigenem Modell wieder bereitgestellt. Zum Start ist das ein begleitetes Angebot mit Cloudflares Forward-Deployed-Engineers über ein Design-Partner-Formular; eine Self-Service-Variante ist angekündigt, Preise sind nicht veröffentlicht.
Einordnung: Clef, Jev und Laya
| Clef / Clef-flash | Jev | Laya | |
|---|---|---|---|
| Lizenz | Apache 2.0, Open Weights | proprietäre API | Apache 2.0, Open Weights |
| Betrieb | Workers AI oder Self-Hosting | nur API (USA) | nur Self-Hosting |
| Größe | 27B / 9B (Qwen-Basis) | nicht veröffentlicht | 0,3 bis 0,4B (Encoder) |
| Eingaben | Text, JSON, Bilder, Video | Text, JSON | Text, JSON |
| Kontext | 65.536 Token | 64.000 Token kombiniert | 512 bis 1.024 Token, Fenster bis 8.192 |
| Preis gehostet | 0,24 / 0,09 USD pro 1M Input | 0,042 USD pro 1M Input | keine gehostete API |
| EU-Residenz | per Self-Hosting | nicht dokumentiert | per Self-Hosting |
Clef schließt die Lücke zwischen Jev (stark, aber geschlossen und US-gehostet) und Laya (offen, aber klein): ein offenes Modell mit Backbone in LLM-Größe, Bild- und Videoeingabe und einer gehosteten Option mit Preis. Der Preis liegt über Jev, die Latenz von Clef-flash darunter. Kein Modell der drei ersetzt ein LLM; für Text, Zusammenfassungen und Code bleiben Modelle wie Qwen, Mistral oder GPT-OSS zuständig.
Unsere Empfehlung
Für Unternehmen im DACH-Raum ist Clef vor allem als selbst gehostetes Entscheidungsmodell interessant: offene Lizenz, Jev-kompatible Schnittstelle, Bild- und Videoeingabe, und mit Clef-flash eine Variante, die auf einer einzelnen GPU läuft. Prüfen Sie vor dem Einsatz drei Punkte: Out-of-Scope-Erkennung bei Clef-flash, die Sprachqualität auf deutschen Daten (Cloudflare veröffentlicht nur englische Benchmarks) und beim gehosteten Betrieb die Vertragslage zur Verarbeitungsregion. Als Vorstufe zu Sprachmodellen in CompanyGPT oder als Router im AI Gateway prüfen wir den Einsatz projektbezogen. Für eine Einschätzung, ob ein Entscheidungsmodell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.
