↓ Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
DECISION Fastino

GLiNER2.5-Decide (Fastino)

GLiNER2.5-Decide von Fastino: offenes Entscheidungsmodell (340 Mio. Parameter, Apache 2.0) mit Wahrscheinlichkeiten statt Text, CPU oder GPU, multilingual für Deutsch.

Lizenz Apache 2.0
DSGVO-Hosting Verfügbar
Modalität Text → Entscheidungen zu typisierten Fragen (Einzel-, Mehrfach- oder geordnete Antwort) mit Wahrscheinlichkeiten

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
GLiNER2.5-Decide (340M)
24. September 2026
340 Millionen Parameter, DeBERTa-v3-large-Encoder, Apache 2.0; läuft laut Modellkarte auf CPU oder GPU über die GLiNER2-Bibliothek Typisierte Fragen mit erlaubten Antworten; ein beschränkter Decoder sucht laut Fastino die höchstbewertete gemeinsame Zuordnung, die die deklarierten Regeln erfüllt Laut Fastino (interner Benchmark, 17 Datensätze, 5.100 Beispiele): 60,1 % im Durchschnitt, Support-Intent 75,3 %, Banking-Intent 64,3 % Mittlere Latenz laut Fastino: 38,3 ms (V100), 43,6 ms (T4), 43,4 ms (L4), 47,3 ms (A100), 167,3 ms auf 48-vCPU-Xeon Betrieb in abgeschotteten Umgebungen möglich (laut Fastino)
Laut Modellkarte für englischen Text; für Deutsch ist die multilinguale Variante vorgesehen Kein Allzweckmodell: keine Schlussfolgerung, keine Erklärungen, keine offenen Antworten (Modellkarte) Alle Vergleichswerte stammen vom Hersteller aus einem internen Benchmark, nicht aus JevBench Nur Texteingabe
Aktuell
GLiNER2.5-multi-Decide (287M, multilingual) Empfohlen
nicht angegeben
287 Millionen Parameter auf mDeBERTa-v3-base, multilingual; laut Modellkarte zu verwenden, wenn die Eingabe mehrsprachig ist Apache 2.0, läuft über die GLiNER2-Bibliothek
Laut Modellkarte 56,7 % Exact-Match-Genauigkeit im internen Benchmark über 17 Domänen (Basismodell: 60,2 % laut Modellkarte) Keine gesonderte Deutsch-Auswertung veröffentlicht
Aktuell
GLiNER2.5-Decide-1B
nicht angegeben
Rund 1 Milliarde Parameter (Ettin-Encoder), Apache 2.0, englisch Laut Modellkarte 59,6 % Exact-Match-Genauigkeit auf fast-decisions über 17 Domänen
Englisch; größer als das 340M-Basismodell
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Intent-Routing für Support- und Banking-Anfragen
Sentiment- und Dokumenttyp-Klassifizierung
Ticket- und E-Mail-Routing
Ja/Nein-Fragen über Textpassagen
Sicherheitsklassifizierung mit konsistenten Mehrfachlabels
Vorstufe vor teuren Sprachmodellen

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Gewichte auf Hugging Face (GLiNER2-Bibliothek, CPU oder GPU); gehostete Inferenz-API von Fastino unter agent.fastino.ai
Latenz (TTFT) 167,3 ms (48-vCPU-Xeon) bis 38,3 ms (V100) im Median bei 64 Token (Fastino-Messung)
Features & Capabilities
Structured Output
Training & Wissen
Wissensstand nicht dokumentiert
Fine-Tuning Verfügbar (Eigenes Fine-Tuning der offenen Gewichte, Fastino API als Inferenz- und Fine-Tuning-Plattform (laut Fastino-Website))
Sprachunterstützung
Beste Qualität Englisch
Unterstützt Basismodell englisch; multilinguale Variante GLiNER2.5-multi-Decide (mDeBERTa-v3-base)
Für Deutsch die multilinguale Variante verwenden und vor dem Einsatz auf eigenen deutschen Daten evaluieren; Fastino veröffentlicht keine Deutsch-Auswertung

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene EU-Infrastruktur oder EU-Cloud
Empfohlen für EU-Residenz: Apache-2.0-Gewichte, CPU-fähig, GLiNER2-Bibliothek
Fastino API
nicht dokumentiert
Gehostete API unter agent.fastino.ai; keine dokumentierte EU-Datenresidenz
Lizenz & Hosting
Lizenz Apache 2.0
Sicherheitsfilter Keine (Entscheidungsmodell ohne Textgenerierung)
On-Premise

Benchmarks

Leistungsvergleich mit standardisierten Tests

Fast Decisions, Durchschnitt (GLiNER2.5-Decide, Fastino intern)
60.1
Support-Intent (GLiNER2.5-Decide, Fastino intern)
75.3
Banking-Intent (GLiNER2.5-Decide, Fastino intern)
64.3

innFactory AI Consulting aus Rosenheim nimmt GLiNER2.5-Decide auf, weil Fastino damit ein weiteres offenes Modell der System-One-Kategorie veröffentlicht hat, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben. Grundlage dieser Seite sind der Ankündigungsbeitrag von Fastino vom 24. September 2026, die Modellkarten auf Hugging Face (GLiNER2.5-Decide, GLiNER2.5-multi-Decide, GLiNER2.5-Decide-1B) und das GLiNER2-Paper. Stand dieser Übersicht: Oktober 2026.

Was ist GLiNER2.5-Decide?

Entscheidungsmodelle, auch System-One-Modelle genannt, erzeugen keinen Text. Sie nehmen einen Zustand und eine Liste typisierter Fragen entgegen und geben für vordefinierte Antworten Wahrscheinlichkeiten zurück. Das eignet sich für Routing, Triage und Prüfschritte vor oder neben einem Sprachmodell. Bekannte Vertreter sind Jev, Cloudflare Clef und Laya.

GLiNER2.5-Decide von Fastino ist ein solches Modell mit 340 Millionen Parametern unter Apache 2.0. Technisch ist es ein Encoder auf Basis von DeBERTa-v3-large, kein generatives Modell. Die Linie reicht zurück zu GLiNER2 (Zaratiana et al., arXiv, 24. Juli 2025), einem encoderbasierten System, das Entitätserkennung, Textklassifizierung und strukturierte Extraktion über eine schemagesteuerte Schnittstelle in einem Modell vereint. Laut Modellkarte ist GLiNER2.5-Decide ein „specialist classifier for operational decisions“ für Intent-Routing, Sentiment, Dokumentklassifizierung und Ja/Nein-Fragen über Passagen; es hat „no reasoning, no explanations, no open-ended answers“.

Eingaben, Schema und Ausgabe

Das Modell erhält einen Text und eine Menge typisierter Fragen. Laut Fastino legt jede Frage ihre erlaubten Antworten fest und ob eine Antwort, mehrere Antworten oder ein geordneter Wert erwartet werden. Der Encoder berechnet für jede erlaubte Antwort einen Kompatibilitätswert; ein beschränkter Decoder sucht anschließend die höchstbewertete gemeinsame Zuordnung, die die deklarierten Regeln erfüllt. Fastino zeigt das an einer Sicherheitsklassifizierung: Unabhängig entschieden ergibt sich „safe“ (0,52) neben „prompt_injection“ (0,82), die gemeinsame Dekodierung liefert stimmig „unsafe“ und „prompt_injection“.

In der Praxis laden Sie das Modell über die Python-Bibliothek gliner2 (AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")) und übergeben Text und Label-Mengen; die Ausgabe ist ein Dictionary mit einer Vorhersage je Label-Kopf. Die Dokumentation steht unter docs.fastino.ai.

Varianten

GLiNER2.5-DecideGLiNER2.5-multi-DecideGLiNER2.5-Decide-1B
Parameter340 Millionen287 Millionenrund 1 Milliarde
EncoderDeBERTa-v3-largemDeBERTa-v3-baseEttin-Encoder (1B)
SprachenEnglischmultilingualEnglisch
Genauigkeit (Modellkarte, interner Benchmark, 17 Domänen)60,2 %56,7 %59,6 %
LizenzApache 2.0Apache 2.0Apache 2.0

Wichtig für den deutschen Markt: Das Basismodell ist laut Modellkarte englisch. Für deutschen Text brauchen Sie die multilinguale Variante, die laut Modellkarte bei mehrsprachigen Eingaben zu verwenden ist. Fastino veröffentlicht keine Deutsch-Auswertung, evaluieren Sie daher auf eigenen Daten.

Benchmarks: Fastinos Angaben

Fastino vergleicht auf dem internen Benchmark „Fast Decisions“ (17 Datensätze, 5.100 Beispiele). Es sind Herstellerangaben, laut Fastino ein interner Benchmark und nicht JevBench.

ModellDurchschnitt (laut Fastino, interner Benchmark)
GLiNER2.5-Decide60,1 % (führt laut Fastino bei 9 von 17 Datensätzen)
JevK557,5 %
SemIf56,4 %
GLiFormer49,0 %
Laya46,6 %

Einzelwerte für GLiNER2.5-Decide: Support-Intent 75,3 %, Banking-Intent 64,3 %. Die Modellkarte nennt 60,2 % Exact-Match-Genauigkeit, der Blog 60,1 %; wir führen den Blogwert und weisen auf die Abweichung hin.

Latenz und Hardware

Laut Fastino liegt die mittlere Latenz (p50, Ende zu Ende, 64 Token) bei:

Hardwarep50
Intel Xeon Platinum 8581C (48 vCPU)167,3 ms
NVIDIA V10038,3 ms
NVIDIA T443,6 ms
NVIDIA L443,4 ms
NVIDIA A10047,3 ms

Bei 1.024 Token nennt Fastino 52,6 ms (A100), 75,6 ms (V100) und 131,4 ms (L4). Das Modell läuft laut Fastino lokal auf CPUs und kann in abgeschotteten Umgebungen betrieben werden. Für Fastinos gehostete Inferenz nennt der Blog die API https://agent.fastino.ai.

Datenschutz, Regionen und Self-Hosting

Die Gewichte aller drei Varianten stehen unter Apache 2.0 auf Hugging Face. Da das Modell mit 340 Millionen Parametern auf CPU oder GPU läuft, lässt es sich auf eigener Infrastruktur oder bei einem EU-Cloud-Anbieter betreiben; die Verarbeitung bleibt dann in der EU und Daten verlassen Ihre Umgebung nicht. Für Fastinos gehostete API ist eine EU-Datenresidenz nicht dokumentiert, ebenso wie ein Firmensitz auf der Fastino-Website. Bei personenbezogenen Daten empfehlen wir das Self-Hosting oder eine vorherige vertragliche Klärung mit dem Hersteller.

Einordnung: GLiNER2.5-Decide, Jev, Clef-flash und Laya

GLiNER2.5-DecideJevClef-flashLaya
Größe340M (Encoder)nicht veröffentlicht9B (Qwen-Basis)0,3 bis 0,4B (Encoder)
LizenzApache 2.0, Open Weightsproprietäre APIApache 2.0, Open WeightsApache 2.0, Open Weights
BetriebSelf-Hosting, Fastino-APInur API (USA)Workers AI oder Self-Hostingnur Self-Hosting
EingabenTextText, JSONText, JSON, Bilder, VideoText, JSON
Kontextnicht ausgewiesen64.000 Token65.536 Token512 bis 1.024 Token
SprachenBasis englisch, multi-Variante multilingualnicht ausgewiesennicht ausgewiesennicht ausgewiesen
EU-Residenzper Self-Hostingnicht dokumentiertper Self-Hostingper Self-Hosting

GLiNER2.5-Decide liegt größenmäßig zwischen Laya und Clef-flash, bleibt wie Laya ein kleiner Encoder und braucht keine GPU. Die Benchmarkwerte der Anbieter stammen aus jeweils eigenen Messungen und sind nicht direkt vergleichbar. Kein Modell dieser Gruppe ersetzt ein LLM; für Text, Zusammenfassungen und Code bleiben Modelle wie Qwen oder Mistral zuständig.

Unsere Empfehlung

Für Unternehmen im DACH-Raum ist GLiNER2.5-Decide vor allem als selbst gehosteter, CPU-fähiger Klassifizierer interessant, etwa für Intent-Routing und Ticket-Triage. Prüfen Sie vor dem Einsatz zwei Punkte: Für deutsche Texte brauchen Sie die multilinguale Variante, die Sie auf eigenen Daten evaluieren sollten, und die Herstellerwerte stammen aus einem internen Benchmark. Als Vorstufe zu Sprachmodellen in CompanyGPT oder als Router im AI Gateway prüfen wir den Einsatz projektbezogen. Für eine Einschätzung, ob ein Entscheidungsmodell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.

Verwandte Entscheidungsmodelle

Zur Kategorie der Entscheidungsmodelle (System One) gehören auch Microsoft-Decision-1, Cloudflare Clef, Laya, Jev, Julia-1. Auch OpenAI geht mit der Decisions API auf Basis von GPT-6 Luna in diese Richtung; Details stehen auf der Seite OpenAI GPT.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Häufig gestellte Fragen

Was ist GLiNER2.5-Decide?

GLiNER2.5-Decide ist ein am 24. September 2026 von Fastino veröffentlichtes, offenes Entscheidungsmodell mit 340 Millionen Parametern unter Apache 2.0. Es ist ein Encoder (DeBERTa-v3-large) und erzeugt keinen Text: Es nimmt einen Text und typisierte Fragen mit erlaubten Antworten entgegen und gibt für jede Antwort einen Kompatibilitätswert zurück. Laut Modellkarte ist es ein Spezialist für operative Entscheidungen wie Intent-Routing, Sentiment, Dokumentklassifizierung und Ja/Nein-Fragen über Passagen, kein Allzweckmodell.

Versteht GLiNER2.5-Decide Deutsch?

Das Basismodell GLiNER2.5-Decide (340M) ist laut Modellkarte für englischen Text vorgesehen. Für mehrsprachige Eingaben verweist Fastino auf die Variante GLiNER2.5-multi-Decide (287 Millionen Parameter, mDeBERTa-v3-base). Fastino veröffentlicht keine gesonderte Auswertung für Deutsch; prüfen Sie die multilinguale Variante vor dem Einsatz auf eigenen deutschen Daten.

Wie schneidet GLiNER2.5-Decide in den Benchmarks ab?

Laut Fastino (interner Benchmark „Fast Decisions“, 17 Datensätze, 5.100 Beispiele) erreicht GLiNER2.5-Decide 60,1 Prozent im Durchschnitt, gefolgt von JevK5 mit 57,5, SemIf mit 56,4, GLiFormer mit 49,0 und Laya mit 46,6 Prozent. Fastino weist selbst darauf hin, dass es ein interner Benchmark und nicht JevBench ist. Es sind Herstellerangaben ohne unabhängige Überprüfung.

Wie schnell ist GLiNER2.5-Decide und welche Hardware braucht es?

Laut Fastino liegt die mittlere Latenz (p50, Ende zu Ende, 64 Token) bei 167,3 ms auf einer 48-vCPU-Intel-Xeon-CPU, 38,3 ms auf einer V100, 43,6 ms auf einer T4, 43,4 ms auf einer L4 und 47,3 ms auf einer A100. Bei 1.024 Token sind es 52,6 ms auf der A100. Das Modell läuft laut Modellkarte auf CPU oder GPU über die GLiNER2-Bibliothek und kann laut Fastino in abgeschotteten Umgebungen betrieben werden.

Ist GLiNER2.5-Decide DSGVO-konform nutzbar?

Die Gewichte stehen unter Apache 2.0 auf Hugging Face, das Modell ist CPU-fähig und lässt sich auf eigener Infrastruktur oder bei einem EU-Anbieter selbst betreiben; damit bleibt die Verarbeitung in der EU. Fastino bietet zusätzlich eine gehostete API (agent.fastino.ai) an, eine Datenresidenz in der EU ist dort nicht dokumentiert. Für personenbezogene Daten empfehlen wir deshalb das Self-Hosting.

Worin unterscheidet sich GLiNER2.5-Decide von Jev, Clef und Laya?

Alle vier sind Entscheidungsmodelle (System One), die Wahrscheinlichkeiten statt Text liefern. GLiNER2.5-Decide ist mit 340 Millionen Parametern ein offener Encoder, Jev eine proprietäre API, Clef-flash ein offenes 9B-Modell auf Qwen-Basis mit Bild- und Videoeingabe, Laya ein offener Encoder mit 0,3 bis 0,4 Milliarden Parametern. Das Basismodell von GLiNER2.5-Decide ist englisch, Clef und Jev weisen keine Sprachabdeckung aus.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.