innFactory AI Consulting aus Rosenheim nimmt GLiNER2.5-Decide auf, weil Fastino damit ein weiteres offenes Modell der System-One-Kategorie veröffentlicht hat, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben. Grundlage dieser Seite sind der Ankündigungsbeitrag von Fastino vom 24. September 2026, die Modellkarten auf Hugging Face (GLiNER2.5-Decide, GLiNER2.5-multi-Decide, GLiNER2.5-Decide-1B) und das GLiNER2-Paper. Stand dieser Übersicht: Oktober 2026.
Was ist GLiNER2.5-Decide?
Entscheidungsmodelle, auch System-One-Modelle genannt, erzeugen keinen Text. Sie nehmen einen Zustand und eine Liste typisierter Fragen entgegen und geben für vordefinierte Antworten Wahrscheinlichkeiten zurück. Das eignet sich für Routing, Triage und Prüfschritte vor oder neben einem Sprachmodell. Bekannte Vertreter sind Jev, Cloudflare Clef und Laya.
GLiNER2.5-Decide von Fastino ist ein solches Modell mit 340 Millionen Parametern unter Apache 2.0. Technisch ist es ein Encoder auf Basis von DeBERTa-v3-large, kein generatives Modell. Die Linie reicht zurück zu GLiNER2 (Zaratiana et al., arXiv, 24. Juli 2025), einem encoderbasierten System, das Entitätserkennung, Textklassifizierung und strukturierte Extraktion über eine schemagesteuerte Schnittstelle in einem Modell vereint. Laut Modellkarte ist GLiNER2.5-Decide ein „specialist classifier for operational decisions“ für Intent-Routing, Sentiment, Dokumentklassifizierung und Ja/Nein-Fragen über Passagen; es hat „no reasoning, no explanations, no open-ended answers“.
Eingaben, Schema und Ausgabe
Das Modell erhält einen Text und eine Menge typisierter Fragen. Laut Fastino legt jede Frage ihre erlaubten Antworten fest und ob eine Antwort, mehrere Antworten oder ein geordneter Wert erwartet werden. Der Encoder berechnet für jede erlaubte Antwort einen Kompatibilitätswert; ein beschränkter Decoder sucht anschließend die höchstbewertete gemeinsame Zuordnung, die die deklarierten Regeln erfüllt. Fastino zeigt das an einer Sicherheitsklassifizierung: Unabhängig entschieden ergibt sich „safe“ (0,52) neben „prompt_injection“ (0,82), die gemeinsame Dekodierung liefert stimmig „unsafe“ und „prompt_injection“.
In der Praxis laden Sie das Modell über die Python-Bibliothek gliner2 (AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")) und übergeben Text und Label-Mengen; die Ausgabe ist ein Dictionary mit einer Vorhersage je Label-Kopf. Die Dokumentation steht unter docs.fastino.ai.
Varianten
| GLiNER2.5-Decide | GLiNER2.5-multi-Decide | GLiNER2.5-Decide-1B | |
|---|---|---|---|
| Parameter | 340 Millionen | 287 Millionen | rund 1 Milliarde |
| Encoder | DeBERTa-v3-large | mDeBERTa-v3-base | Ettin-Encoder (1B) |
| Sprachen | Englisch | multilingual | Englisch |
| Genauigkeit (Modellkarte, interner Benchmark, 17 Domänen) | 60,2 % | 56,7 % | 59,6 % |
| Lizenz | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Wichtig für den deutschen Markt: Das Basismodell ist laut Modellkarte englisch. Für deutschen Text brauchen Sie die multilinguale Variante, die laut Modellkarte bei mehrsprachigen Eingaben zu verwenden ist. Fastino veröffentlicht keine Deutsch-Auswertung, evaluieren Sie daher auf eigenen Daten.
Benchmarks: Fastinos Angaben
Fastino vergleicht auf dem internen Benchmark „Fast Decisions“ (17 Datensätze, 5.100 Beispiele). Es sind Herstellerangaben, laut Fastino ein interner Benchmark und nicht JevBench.
| Modell | Durchschnitt (laut Fastino, interner Benchmark) |
|---|---|
| GLiNER2.5-Decide | 60,1 % (führt laut Fastino bei 9 von 17 Datensätzen) |
| JevK5 | 57,5 % |
| SemIf | 56,4 % |
| GLiFormer | 49,0 % |
| Laya | 46,6 % |
Einzelwerte für GLiNER2.5-Decide: Support-Intent 75,3 %, Banking-Intent 64,3 %. Die Modellkarte nennt 60,2 % Exact-Match-Genauigkeit, der Blog 60,1 %; wir führen den Blogwert und weisen auf die Abweichung hin.
Latenz und Hardware
Laut Fastino liegt die mittlere Latenz (p50, Ende zu Ende, 64 Token) bei:
| Hardware | p50 |
|---|---|
| Intel Xeon Platinum 8581C (48 vCPU) | 167,3 ms |
| NVIDIA V100 | 38,3 ms |
| NVIDIA T4 | 43,6 ms |
| NVIDIA L4 | 43,4 ms |
| NVIDIA A100 | 47,3 ms |
Bei 1.024 Token nennt Fastino 52,6 ms (A100), 75,6 ms (V100) und 131,4 ms (L4). Das Modell läuft laut Fastino lokal auf CPUs und kann in abgeschotteten Umgebungen betrieben werden. Für Fastinos gehostete Inferenz nennt der Blog die API https://agent.fastino.ai.
Datenschutz, Regionen und Self-Hosting
Die Gewichte aller drei Varianten stehen unter Apache 2.0 auf Hugging Face. Da das Modell mit 340 Millionen Parametern auf CPU oder GPU läuft, lässt es sich auf eigener Infrastruktur oder bei einem EU-Cloud-Anbieter betreiben; die Verarbeitung bleibt dann in der EU und Daten verlassen Ihre Umgebung nicht. Für Fastinos gehostete API ist eine EU-Datenresidenz nicht dokumentiert, ebenso wie ein Firmensitz auf der Fastino-Website. Bei personenbezogenen Daten empfehlen wir das Self-Hosting oder eine vorherige vertragliche Klärung mit dem Hersteller.
Einordnung: GLiNER2.5-Decide, Jev, Clef-flash und Laya
| GLiNER2.5-Decide | Jev | Clef-flash | Laya | |
|---|---|---|---|---|
| Größe | 340M (Encoder) | nicht veröffentlicht | 9B (Qwen-Basis) | 0,3 bis 0,4B (Encoder) |
| Lizenz | Apache 2.0, Open Weights | proprietäre API | Apache 2.0, Open Weights | Apache 2.0, Open Weights |
| Betrieb | Self-Hosting, Fastino-API | nur API (USA) | Workers AI oder Self-Hosting | nur Self-Hosting |
| Eingaben | Text | Text, JSON | Text, JSON, Bilder, Video | Text, JSON |
| Kontext | nicht ausgewiesen | 64.000 Token | 65.536 Token | 512 bis 1.024 Token |
| Sprachen | Basis englisch, multi-Variante multilingual | nicht ausgewiesen | nicht ausgewiesen | nicht ausgewiesen |
| EU-Residenz | per Self-Hosting | nicht dokumentiert | per Self-Hosting | per Self-Hosting |
GLiNER2.5-Decide liegt größenmäßig zwischen Laya und Clef-flash, bleibt wie Laya ein kleiner Encoder und braucht keine GPU. Die Benchmarkwerte der Anbieter stammen aus jeweils eigenen Messungen und sind nicht direkt vergleichbar. Kein Modell dieser Gruppe ersetzt ein LLM; für Text, Zusammenfassungen und Code bleiben Modelle wie Qwen oder Mistral zuständig.
Unsere Empfehlung
Für Unternehmen im DACH-Raum ist GLiNER2.5-Decide vor allem als selbst gehosteter, CPU-fähiger Klassifizierer interessant, etwa für Intent-Routing und Ticket-Triage. Prüfen Sie vor dem Einsatz zwei Punkte: Für deutsche Texte brauchen Sie die multilinguale Variante, die Sie auf eigenen Daten evaluieren sollten, und die Herstellerwerte stammen aus einem internen Benchmark. Als Vorstufe zu Sprachmodellen in CompanyGPT oder als Router im AI Gateway prüfen wir den Einsatz projektbezogen. Für eine Einschätzung, ob ein Entscheidungsmodell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.
Verwandte Entscheidungsmodelle
Zur Kategorie der Entscheidungsmodelle (System One) gehören auch Microsoft-Decision-1, Cloudflare Clef, Laya, Jev, Julia-1. Auch OpenAI geht mit der Decisions API auf Basis von GPT-6 Luna in diese Richtung; Details stehen auf der Seite OpenAI GPT.
