innFactory AI Consulting aus Rosenheim nimmt Laya in die Modellübersicht auf, weil es die Idee des System-One-Modells, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben, als offenes Modell verfügbar macht. Für Unternehmen im DACH-Raum ist das der entscheidende Unterschied: Laya lässt sich auf eigener Infrastruktur in der EU betreiben. Grundlage dieser Seite sind die Modellkarte auf Hugging Face, das GitHub-Repository und die Dokumentation des Herstellers. Stand: 30. September 2026.
Was ist Laya?
Laya ist eine Familie nicht-autoregressiver Entscheidungsmodelle von Convai Innovations Pvt. Ltd. aus Kasaragod (Kerala, Indien), einem Unternehmen, das nach eigener Beschreibung souveräne On-Device-KI für Anwendungssicherheit, Compliance und klinische Forschung baut. Die Modelle erschienen im September 2026 unter Apache-2.0-Lizenz auf Hugging Face.
Das Prinzip ist dasselbe wie bei Jev: Ein State (Text oder JSON) und typisierte Fragen gehen hinein, typisierte Antworten mit kalibrierten Wahrscheinlichkeiten kommen heraus, alle Fragen in einem einzigen Vorwärtsdurchlauf. Drei Fragearten sind möglich: Choice (eine Option aus einer Liste), Score (eine Stufe auf einer geordneten Skala) und Noul (Wahrscheinlichkeit für Ja). Laya erzeugt keinen Text.
Technisch besteht Laya aus einem Encoder-Backbone und einem eigenen Entscheidungskopf: zwei Transformer-Schichten, ein Scorer für Options-Marker an [MASK]-Positionen und ein Act/Escalate-Kopf. Trainiert wird laut Modellkarte mit Reinforcement Learning for Calibrated Decisions (RLCD) gegen strikt korrekte Bewertungsregeln.
Drei Checkpoints
| Checkpoint | Backbone | Parameter | Kontext | Einsatz |
|---|---|---|---|---|
laya | ModernBERT-large | 421M | 512 Token | Englisch, Basis für eigenes Fine-Tuning |
laya-multilingual | mmBERT-base | 322M | 1.024 Token (bis 8.192 in Fenstern) | über 100 Sprachen |
laya-typed-decisions | ModernBERT-large | 421M | 1.024 Token | auf typisierte Entscheidungen feinabgestimmt |
Ein eingebauter Router erkennt Schrift und Sprache der Eingabe und wählt den passenden Checkpoint mit unter einer Millisekunde Zusatzaufwand.
Vergleichswerte des Herstellers
Convai veröffentlicht in der Modellkarte eigene Messungen gegen Jev. Wichtig zur Einordnung: Es sind Herstellerangaben, ein Paper oder eine unabhängige Evaluation gibt es noch nicht.
| Messung | Laya | Jev (laut Convai) |
|---|---|---|
| typed-decisions, Genauigkeit (feinabgestimmt) | 0,766 | 0,727 |
| AG News, Genauigkeit | 0,950 | 0,910 |
| ECE nach Temperatur-Kalibrierung | 0,081 | 0,144 |
| Latenz, eine Frage (Tesla T4) | 32,8 bis 39,5 ms | 236 bis 276 ms |
| Choice mit 77 Optionen, Genauigkeit | 0,425 | 0,870 |
Die letzte Zeile zeigt die Grenze: Bei vielen Optionen fällt Laya deutlich ab und braucht ein größeres Token-Budget oder eine Vorauswahl per Embeddings. Ebenfalls dokumentiert: Die Basis-Checkpoints liegen ohne Fine-Tuning auf typed-decisions bei 0,362 und damit unter der Mehrheitsklasse (0,461); Score-Fragen sind die schwächste Frageart (SST-5: 0,372); ohne Temperatur-Kalibrierung ist das Modell überkonfident.
Betrieb: offen, lokal, Jev-kompatibel
- Installation:
pip install laya, Gewichte werden von Hugging Face geladen; Nutzung über das SDK (laya.load,decide()mit JSON-Schema) oder als Transformers-Pipeline. - HTTP:
laya-servestellt den Jev-kompatiblen EndpunktPOST /v1/systemonebereit; wer für Jev entwickelt hat, kann die Basis-URL umstellen. Optional ein MCP-Server mit Werkzeugen für Einzel- und Batch-Vorhersagen. - Hardware: CPU, GPU (CUDA, MPS, XPU) und TPU; Docker-Container für CPU, NVIDIA-GPU, ARM64 und DGX Spark. Im Batch verarbeitet eine Tesla T4 laut Hersteller 103 bis 332 Fragen pro Sekunde.
- Edge und Browser: ONNX-Export mit INT8-Quantisierung; das TypeScript-SDK führt Inferenz per ONNX direkt im Browser aus.
- Fine-Tuning: Das SDK enthält Training und RLCD; für produktive Genauigkeit ist eine Anpassung auf die eigene Aufgabe nach Angaben der Modellkarte in der Regel nötig.
Datenschutz und Souveränität
Laya verlässt die eigene Infrastruktur nicht: keine gehostete API, keine Telemetrie an den Hersteller, Gewichte unter Apache 2.0. Damit erfüllt es die Anforderung, die viele unserer Kunden an Klassifizierer im Posteingang, im Ticketsystem oder in Guardrails stellen: Personenbezogene Daten bleiben im eigenen Rechenzentrum oder bei einem EU-Cloud-Anbieter. Die Verantwortung für Betrieb, Kalibrierung und Evaluation liegt dafür vollständig beim Unternehmen.
Einordnung gegenüber Jev
| Laya | Jev | |
|---|---|---|
| Lizenz und Betrieb | Apache 2.0, Self-Hosting | proprietäre API in den USA |
| Modellgröße | 322 bis 421 Millionen Parameter (Encoder) | nicht veröffentlicht |
| Sprachverständnis | Encoder-Klasse, Fine-Tuning meist nötig | laut TypeSafe Frontier-Nähe, Anpassung über Prompt |
| Kontext | 512 bis 1.024 Token, Fenster bis 8.192 | 64.000 Token kombiniert |
| Kosten | Infrastruktur | 0,042 USD pro 1M Input-Token |
| Datenschutz | Daten bleiben im Haus | DPA mit EU-SCC, Zero Data Retention für Enterprise |
Für eng umrissene, gut trainierbare Aufgaben mit Datenhoheit ist Laya die naheliegende Wahl; für breite, wechselnde Fragen ohne Trainingsdaten und ohne EU-Pflicht bleibt Jev stärker. Seit dem 1. Oktober 2026 gibt es mit Clef und Clef-flash von Cloudflare eine dritte Option: offene Modelle mit 27 und 9 Milliarden Parametern, Bild- und Videoeingabe und Jev-kompatibler Schnittstelle, gehostet auf Workers AI oder selbst betrieben. Beide ersetzen kein LLM: Für Texte, Zusammenfassungen und Code bleiben Modelle wie Mistral, Qwen oder GPT-OSS im Self-Hosting zuständig.
Integration mit CompanyGPT und AI Gateway
Als selbst gehostetes Modell lässt sich Laya neben den LLMs in der eigenen EU-Cloud betreiben, etwa als Vorstufe, die Anfragen klassifiziert und an das passende Sprachmodell weiterreicht. Wir prüfen den Einsatz projektbezogen, zum Beispiel für Routing und Guardrails in CompanyGPT-Workflows. Für eine Einschätzung, ob ein System-One-Modell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.
