↓ Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
SPECIALIZED Convai Innovations Indien

Laya (Convai Innovations)

Laya von Convai Innovations ist ein offenes, nicht-autoregressives Entscheidungsmodell (Apache 2.0, 322 bis 421 Millionen Parameter) mit Jev-kompatibler API: Choice, Score und Noul mit kalibrierten Wahrscheinlichkeiten in rund 33 bis 40 ms je Frage. Gewichte auf Hugging Face, Self-Hosting auf eigener EU-Infrastruktur, CPU, GPU, ONNX oder im Browser. Stand: 30. September 2026.

Lizenz Apache 2.0
DSGVO-Hosting Verfügbar
Kontext 8192 Tokens
Modalität Text, JSON → Typisierte Entscheidungen (Choice, Score, Noul) mit Wahrscheinlichkeiten

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
laya-typed-decisions (ModernBERT-large, 421M)
September 2026 (erster Upload auf Hugging Face Mitte September 2026, Paket laya 0.3.x)
Auf typisierte Entscheidungen feinabgestimmt: laut Modellkarte 0,766 Genauigkeit auf typed-decisions (Jev: 0,727) und 0,950 auf AG News (Jev: 0,910) Kalibrierte Wahrscheinlichkeiten, ECE 0,081 nach Temperatur-Kalibrierung (Herstellerangabe) 1.024 Token Kontext, Langdokumente per predict_long in Fenstern bis 8.192 Token Jev-kompatibler Endpunkt POST /v1/systemone über laya-serve, optionaler MCP-Server Läuft auf CPU, GPU (CUDA, MPS, XPU) und TPU; ONNX-Export mit INT8-Quantisierung, TypeScript-SDK für Inferenz im Browser Apache-2.0-Lizenz, Fine-Tuning und RLCD-Training über das SDK
Bei Choice-Fragen mit vielen Optionen (77 Labels) laut Modellkarte 0,425 gegenüber 0,870 bei Jev; Abhilfe über größeres Token-Budget oder Vorauswahl per Embeddings Score-Fragen schwächste Frageart (SST-5: 0,372 laut Modellkarte) Encoder mit 421 Millionen Parametern: kein Frontier-Sprachverständnis, Instruktionen im Request wirken begrenzt Alle Vergleichswerte vom Hersteller, kein Paper, keine unabhängige Evaluation; junges Projekt (seit September 2026)
Aktuell
laya-multilingual (mmBERT-base, 322M)
September 2026
Liest laut Hersteller über 100 Sprachen; 45 von 51 getesteten Sprachen deutlich über Zufallsniveau (Modellkarte) Kleinster Checkpoint: 32,8 ms je Frage und 72,3 ms für zehn Fragen auf einer Tesla T4 (Herstellerangabe) 1.024 Token Kontext, bis 8.192 Token in Fenstern; Router wählt Checkpoint automatisch nach Schrift und Sprache
Wird unkalibriert ausgeliefert, Temperatur-Kalibrierung auf eigenen Daten nötig Positionsbias bei Score-Fragen laut Issue-Tracker des Projekts Keine gesonderte Auswertung für Deutsch veröffentlicht
Aktuell
laya (Englisch, ModernBERT-large, 421M)
September 2026
Englischer Basis-Checkpoint, 39,5 ms je Frage auf einer Tesla T4 (Herstellerangabe) Ausgangspunkt für eigenes Fine-Tuning auf Choice-, Score- und Noul-Aufgaben
Nur 512 Token Kontext Ohne Fine-Tuning auf typed-decisions nahe Zufallsniveau (0,362 bei 0,461 Mehrheitsklasse, laut Modellkarte) Noul-Fragen folgen laut Modellkarte teils den Optionsbezeichnungen statt dem Zustand
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Ticket- und E-Mail-Routing on-premises
Klassifizierung mit Konfidenz in regulierten Umgebungen
Guardrail- und Moderationsentscheidungen ohne Cloud
Scoring auf Rubriken bei hohem Volumen
Entscheidungsknoten in KI-Agenten mit Datenhoheit
Inferenz im Browser oder auf Edge-Geräten

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Keine gehostete API des Herstellers; Self-Hosting per pip install laya, laya-serve (HTTP, Jev-kompatibel), Docker-Container (CPU, NVIDIA GPU, ARM64, DGX Spark), ONNX Runtime, TypeScript-SDK im Browser
Latenz (TTFT) 32,8 bis 39,5 ms je Frage auf Tesla T4 (Herstellerangabe)
Durchsatz 103 bis 332 Fragen/s im Batch auf Tesla T4 (Herstellerangabe) Tokens/Sek
Features & Capabilities
Structured Output
Training & Wissen
Wissensstand nicht dokumentiert (Encoder-Backbones ModernBERT und mmBERT)
Fine-Tuning Verfügbar (Full Fine-Tuning (SDK), RLCD (Reinforcement Learning for Calibrated Decisions))
Sprachunterstützung
Beste Qualität Englisch
Unterstützt Über 100 Sprachen im multilingualen Checkpoint (laut Hersteller); 45 von 51 getesteten Sprachen deutlich über Zufallsniveau
Keine eigene Auswertung für Deutsch veröffentlicht; Evaluation auf eigenen deutschen Daten vor dem Einsatz empfohlen

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene EU-Infrastruktur oder EU-Cloud
Empfohlen: Open Weights, vollständige Datenkontrolle, keine Übermittlung an den Hersteller
Lizenz & Hosting
Lizenz Apache 2.0
Sicherheitsfilter Keine (Entscheidungsmodell ohne Textgenerierung)
On-Premise Edge-fähig

Benchmarks

Leistungsvergleich mit standardisierten Tests

typed-decisions (laya-typed-decisions, Herstellerangabe)
76.6
AG News (Herstellerangabe)
95

innFactory AI Consulting aus Rosenheim nimmt Laya in die Modellübersicht auf, weil es die Idee des System-One-Modells, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben, als offenes Modell verfügbar macht. Für Unternehmen im DACH-Raum ist das der entscheidende Unterschied: Laya lässt sich auf eigener Infrastruktur in der EU betreiben. Grundlage dieser Seite sind die Modellkarte auf Hugging Face, das GitHub-Repository und die Dokumentation des Herstellers. Stand: 30. September 2026.

Was ist Laya?

Laya ist eine Familie nicht-autoregressiver Entscheidungsmodelle von Convai Innovations Pvt. Ltd. aus Kasaragod (Kerala, Indien), einem Unternehmen, das nach eigener Beschreibung souveräne On-Device-KI für Anwendungssicherheit, Compliance und klinische Forschung baut. Die Modelle erschienen im September 2026 unter Apache-2.0-Lizenz auf Hugging Face.

Das Prinzip ist dasselbe wie bei Jev: Ein State (Text oder JSON) und typisierte Fragen gehen hinein, typisierte Antworten mit kalibrierten Wahrscheinlichkeiten kommen heraus, alle Fragen in einem einzigen Vorwärtsdurchlauf. Drei Fragearten sind möglich: Choice (eine Option aus einer Liste), Score (eine Stufe auf einer geordneten Skala) und Noul (Wahrscheinlichkeit für Ja). Laya erzeugt keinen Text.

Technisch besteht Laya aus einem Encoder-Backbone und einem eigenen Entscheidungskopf: zwei Transformer-Schichten, ein Scorer für Options-Marker an [MASK]-Positionen und ein Act/Escalate-Kopf. Trainiert wird laut Modellkarte mit Reinforcement Learning for Calibrated Decisions (RLCD) gegen strikt korrekte Bewertungsregeln.

Drei Checkpoints

CheckpointBackboneParameterKontextEinsatz
layaModernBERT-large421M512 TokenEnglisch, Basis für eigenes Fine-Tuning
laya-multilingualmmBERT-base322M1.024 Token (bis 8.192 in Fenstern)über 100 Sprachen
laya-typed-decisionsModernBERT-large421M1.024 Tokenauf typisierte Entscheidungen feinabgestimmt

Ein eingebauter Router erkennt Schrift und Sprache der Eingabe und wählt den passenden Checkpoint mit unter einer Millisekunde Zusatzaufwand.

Vergleichswerte des Herstellers

Convai veröffentlicht in der Modellkarte eigene Messungen gegen Jev. Wichtig zur Einordnung: Es sind Herstellerangaben, ein Paper oder eine unabhängige Evaluation gibt es noch nicht.

MessungLayaJev (laut Convai)
typed-decisions, Genauigkeit (feinabgestimmt)0,7660,727
AG News, Genauigkeit0,9500,910
ECE nach Temperatur-Kalibrierung0,0810,144
Latenz, eine Frage (Tesla T4)32,8 bis 39,5 ms236 bis 276 ms
Choice mit 77 Optionen, Genauigkeit0,4250,870

Die letzte Zeile zeigt die Grenze: Bei vielen Optionen fällt Laya deutlich ab und braucht ein größeres Token-Budget oder eine Vorauswahl per Embeddings. Ebenfalls dokumentiert: Die Basis-Checkpoints liegen ohne Fine-Tuning auf typed-decisions bei 0,362 und damit unter der Mehrheitsklasse (0,461); Score-Fragen sind die schwächste Frageart (SST-5: 0,372); ohne Temperatur-Kalibrierung ist das Modell überkonfident.

Betrieb: offen, lokal, Jev-kompatibel

  • Installation: pip install laya, Gewichte werden von Hugging Face geladen; Nutzung über das SDK (laya.load, decide() mit JSON-Schema) oder als Transformers-Pipeline.
  • HTTP: laya-serve stellt den Jev-kompatiblen Endpunkt POST /v1/systemone bereit; wer für Jev entwickelt hat, kann die Basis-URL umstellen. Optional ein MCP-Server mit Werkzeugen für Einzel- und Batch-Vorhersagen.
  • Hardware: CPU, GPU (CUDA, MPS, XPU) und TPU; Docker-Container für CPU, NVIDIA-GPU, ARM64 und DGX Spark. Im Batch verarbeitet eine Tesla T4 laut Hersteller 103 bis 332 Fragen pro Sekunde.
  • Edge und Browser: ONNX-Export mit INT8-Quantisierung; das TypeScript-SDK führt Inferenz per ONNX direkt im Browser aus.
  • Fine-Tuning: Das SDK enthält Training und RLCD; für produktive Genauigkeit ist eine Anpassung auf die eigene Aufgabe nach Angaben der Modellkarte in der Regel nötig.

Datenschutz und Souveränität

Laya verlässt die eigene Infrastruktur nicht: keine gehostete API, keine Telemetrie an den Hersteller, Gewichte unter Apache 2.0. Damit erfüllt es die Anforderung, die viele unserer Kunden an Klassifizierer im Posteingang, im Ticketsystem oder in Guardrails stellen: Personenbezogene Daten bleiben im eigenen Rechenzentrum oder bei einem EU-Cloud-Anbieter. Die Verantwortung für Betrieb, Kalibrierung und Evaluation liegt dafür vollständig beim Unternehmen.

Einordnung gegenüber Jev

LayaJev
Lizenz und BetriebApache 2.0, Self-Hostingproprietäre API in den USA
Modellgröße322 bis 421 Millionen Parameter (Encoder)nicht veröffentlicht
SprachverständnisEncoder-Klasse, Fine-Tuning meist nötiglaut TypeSafe Frontier-Nähe, Anpassung über Prompt
Kontext512 bis 1.024 Token, Fenster bis 8.19264.000 Token kombiniert
KostenInfrastruktur0,042 USD pro 1M Input-Token
DatenschutzDaten bleiben im HausDPA mit EU-SCC, Zero Data Retention für Enterprise

Für eng umrissene, gut trainierbare Aufgaben mit Datenhoheit ist Laya die naheliegende Wahl; für breite, wechselnde Fragen ohne Trainingsdaten und ohne EU-Pflicht bleibt Jev stärker. Seit dem 1. Oktober 2026 gibt es mit Clef und Clef-flash von Cloudflare eine dritte Option: offene Modelle mit 27 und 9 Milliarden Parametern, Bild- und Videoeingabe und Jev-kompatibler Schnittstelle, gehostet auf Workers AI oder selbst betrieben. Beide ersetzen kein LLM: Für Texte, Zusammenfassungen und Code bleiben Modelle wie Mistral, Qwen oder GPT-OSS im Self-Hosting zuständig.

Integration mit CompanyGPT und AI Gateway

Als selbst gehostetes Modell lässt sich Laya neben den LLMs in der eigenen EU-Cloud betreiben, etwa als Vorstufe, die Anfragen klassifiziert und an das passende Sprachmodell weiterreicht. Wir prüfen den Einsatz projektbezogen, zum Beispiel für Routing und Guardrails in CompanyGPT-Workflows. Für eine Einschätzung, ob ein System-One-Modell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Häufig gestellte Fragen

Was ist Laya?

Laya ist eine Familie offener Entscheidungsmodelle von Convai Innovations aus Kerala, Indien, veröffentlicht im September 2026 unter Apache-2.0-Lizenz auf Hugging Face. Wie Jev von TypeSafe beantwortet Laya typisierte Fragen (Choice, Score, Noul) zu einem Zustand mit kalibrierten Wahrscheinlichkeiten in einem einzigen Vorwärtsdurchlauf, ohne Text zu erzeugen. Basis sind Encoder-Modelle (ModernBERT-large mit 421 Millionen, mmBERT-base mit 322 Millionen Parametern) plus ein per RLCD trainierter Entscheidungskopf.

Kann ich Laya in der EU betreiben?

Ja. Die Gewichte stehen unter Apache 2.0 auf Hugging Face, das Python-Paket laya liefert SDK, den HTTP-Server laya-serve mit Jev-kompatiblem Endpunkt /v1/systemone, Docker-Container für CPU und NVIDIA-GPU sowie ONNX-Export. Damit läuft Laya auf eigener Infrastruktur oder bei einem EU-Cloud-Anbieter, ohne dass Daten das Unternehmen verlassen. Eine gehostete API des Herstellers gibt es nicht.

Wie schneidet Laya im Vergleich zu Jev ab?

Laut Modellkarte des Herstellers (Stand September 2026) erreicht der feinabgestimmte Checkpoint laya-typed-decisions auf dem eigenen typed-decisions-Benchmark 0,766 Genauigkeit gegenüber 0,727 für Jev und auf AG News 0,950 gegenüber 0,910; die Kalibrierung (ECE) liegt bei 0,081. Bei einer Frage misst Convai auf einer Tesla T4 32,8 ms (multilingual) bis 39,5 ms (Englisch). Bei Choice-Fragen mit vielen Optionen (77 Labels) liegt Jev mit 0,870 gegenüber 0,425 deutlich vorn. Alle Werte stammen vom Hersteller, eine unabhängige Evaluation gibt es noch nicht.

Welche Grenzen hat Laya?

Die Basis-Checkpoints erreichen ohne Fine-Tuning auf dem typed-decisions-Benchmark nur Zufallsniveau (0,362); gute Ergebnisse setzen eine Anpassung auf die eigene Aufgabe voraus. Score-Fragen sind laut Modellkarte die schwächste Frageart, das Modell ist ohne Temperatur-Kalibrierung überkonfident, der multilinguale Checkpoint wird unkalibriert ausgeliefert. Der Kontext liegt je Checkpoint bei 512 oder 1.024 Token, längere Dokumente werden in Fenstern bis 8.192 Token abgetastet. Mit 0,3 bis 0,4 Milliarden Parametern hat Laya nicht das Sprachverständnis eines Frontier-Modells.

Welche Sprachen unterstützt Laya?

Der multilinguale Checkpoint auf mmBERT-Basis liest laut Hersteller über 100 Sprachen; in den Tests der Modellkarte lagen 45 von 51 Sprachen deutlich über Zufallsniveau, beim englischen Checkpoint 23. Eine eigene Auswertung für Deutsch veröffentlicht Convai nicht, eine Evaluation auf eigenen deutschen Daten ist daher Pflicht.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.