innFactory AI Consulting aus Rosenheim nimmt Julia-1 auf, weil das Modell die Kategorie der System-One-Modelle, die wir im Beitrag Jev von TypeSafe: Das KI-Modell, das keinen Text schreibt erklärt haben, um eine sehr kleine, offene und auf CPU lauffähige Variante erweitert. Grundlage dieser Seite sind die Modellkarte SupersonicLabs/Julia-1, die ONNX-Variante Julia-1-ONNX, die Organisationsseite auf Hugging Face und die Website von Supersonic Labs. Ergänzend nennen wir Angaben aus Medienberichten (MarkTechPost, 26. September 2026) und kennzeichnen sie als solche. Stand dieser Übersicht: Oktober 2026.
Was ist Julia-1?
Julia-1 ist ein Entscheidungsmodell, auch System-One-Modell genannt. Ein klassisches Sprachmodell (LLM) erzeugt Text Token für Token. Ein Entscheidungsmodell erzeugt keinen Text: Es bekommt einen Zustand (etwa eine Support-Nachricht), eine Frage und eine Liste vordefinierter Antworten und gibt Wahrscheinlichkeiten über diese Antworten zurück. Das ist schnell, gut prüfbar und für Klassifizierung, Routing und Entscheidungsknoten in Workflows geeignet. Dieselbe Modellklasse behandeln wir bei Jev, Cloudflare Clef und Laya.
Supersonic Labs beschreibt sich auf der Website als „unabhängige Forschung zu nützlicher, lokaler künstlicher Intelligenz“ und Julia-1 als erstes Modell der Julia-Familie. Laut Modellkarte hat Julia-1 144,3 Millionen Parameter und basiert auf mmBERT-small (mehrsprachiger ModernBERT-Encoder der JHU CLSP). Die Lizenz ist Apache 2.0, die Gewichte liegen im Safetensors-Format vor, die Trainingspipeline ist nicht Teil des Repositorys. Julia-1 ist kein Chat- und kein Textgenerierungsmodell.
Eingaben und Fragetypen
Die Schnittstelle ist typisiert, die Fragetypen entsprechen dem Muster der anderen Entscheidungsmodelle:
- choice: eine Option aus 2 bis 20 Einträgen (ID mit Beschreibung).
- score: eine Stufe auf einer geordneten Rubrik mit 2 bis 20 Beschreibungen.
- noul: boolesche Entscheidung, optional mit Beschreibungen für wahr und falsch.
- Kontext: bis zu 8.192 kombinierte Token für Zustand, Frage und Optionen; die Modellkarte nennt als Beispielkonfiguration ein Budget von 512 Token für Frage und Optionen mit höchstens 48 Token je Option.
- Mehr als 20 Optionen: laut Modellkarte engt ein hierarchischer Router die Auswahl über Eingrenzung und Reranking ein. Das gruppierte Ergebnis ist ausdrücklich keine globale Wahrscheinlichkeitsverteilung.
- Eingabe: nur Text. Die Ausgabe sind typisierte Entscheidungen mit Wahrscheinlichkeiten.
Benchmarks: Angaben laut Modellkarte
Alle Werte sind Herstellerangaben, gemessen laut Modellkarte am 24. September 2026 auf einer H200 in BF16.
| Benchmark | Julia-1 (laut Modellkarte) | Vergleich (Jev-Referenz laut Modellkarte) |
|---|---|---|
| Typisierte Entscheidungen, gesamt (2.000 Fragen) | 73,15 % | nicht ausgewiesen |
| davon choice / score / noul | 71,33 % / 68,88 % / 80,67 % | nicht ausgewiesen |
| AG News (4 Labels, 100 Beispiele) | 94 % | 91 % |
| DAIR Emotion (6 Labels, 100 Beispiele) | 86 % | 48 % |
| Banking77 (72 Labels über 16er-Shortlist, 100 Beispiele) | 64 % | 87 % |
| MASSIVE, 18 Labels, 52 Sprachvarianten | 71,5 % | nicht ausgewiesen |
Auf MASSIVE nennt die Modellkarte für Englisch (en-US) 86,75 Prozent und für Portugiesisch (pt-PT) 86,25 Prozent. Die Pilotversuche umfassen nur je 100 Beispiele und sind entsprechend vorsichtig zu lesen. Das schwache Banking77-Ergebnis (64 gegenüber 87 Prozent) steht schon in der Modellkarte; laut Medienberichten (MarkTechPost, 26. September 2026) wird es ebenfalls hervorgehoben. Bei Aufgaben mit vielen ähnlichen Labels sollten Sie Julia-1 daher nur mit Shortlist und eigener Evaluation einsetzen.
Zur Reproduzierbarkeit: Die Modellkarte nennt für CPU-FP32 (26. September) 426 von 600 choice-, 542 von 800 score- und 483 von 600 noul-Fragen richtig, also nahe an den GPU-Werten.
Die Modellkarte benennt Grenzen: Julia-1 kann fehlende Fakten nicht ergänzen, keine Algebra lösen und keine langen Rechenketten tragen; Schwierigkeiten bestehen bei mehrdeutiger Formulierung, unbekannten Domänen und langen Labellisten. Die Benchmarks belegen keine Genauigkeit für eine neue Domäne, jede Sprache oder Hochrisiko-Einsätze.
Hardware und Betrieb
- CPU: Inferenz läuft laut Modellkarte mit einer Standard-PyTorch-Installation (Python 3.11 oder neuer), eine GPU ist nicht erforderlich.
- GPU: optional mit CUDA und BF16 über
device="cuda". - Größe: 550,5 MiB für die FP32-Gewichte.
- ONNX: Julia-1-ONNX enthält einen Export mit WebGPU-Adapter (WGSL-Kernels) und Rust-WebAssembly-Tokenizer sowie ein Node-N-API-Binding. Laut Modellkarte lag die mittlere Latenz im Browser bei 75,47 ms je Entscheidung, 100 von 100 Vorhersagen stimmten mit dem Original überein. Die Genauigkeit wurde für WebGPU nicht erneut geprüft.
- Latenz laut Medienberichten: MarkTechPost nennt rund 33 ms auf einem Apple M4 und rund 203 ms auf der CPU eines Samsung-Tablets. Diese Werte konnten wir in den Primärquellen nicht verifizieren.
Datenschutz und Self-Hosting
Die Gewichte stehen unter Apache 2.0 und das Modell ist klein genug für CPU-Betrieb. Damit ist Self-Hosting in der EU der naheliegende Weg: auf eigener Infrastruktur, bei einem EU-Cloud-Anbieter oder sogar im Browser über die ONNX-Variante, ohne dass Eingaben das System verlassen. Eine vom Hersteller dokumentierte gehostete API haben wir in den geprüften Primärquellen nicht gefunden; laut Medienberichten ist eine API geplant. Den Unternehmensstandort weisen Modellkarte, Hugging-Face-Organisationsseite und Website nicht ausdrücklich aus, wir machen dazu keine Angabe. Für Verarbeitungen mit personenbezogenen Daten gilt wie immer: Auftragsverarbeitung, Rechtsgrundlage und Evaluation vor dem Einsatz klären.
Einordnung: Julia-1, Jev, Clef-flash und Laya
| Julia-1 | Jev | Clef-flash | Laya | |
|---|---|---|---|---|
| Größe | 144,3 Mio. Parameter (mmBERT-small) | nicht veröffentlicht | 9B (Qwen-Basis) | 0,3 bis 0,4B (Encoder) |
| Lizenz | Apache 2.0, Open Weights | proprietäre API | Apache 2.0, Open Weights | Apache 2.0, Open Weights |
| Betrieb | Self-Hosting (CPU möglich), keine dokumentierte gehostete API | nur API (USA) | Workers AI oder Self-Hosting | nur Self-Hosting |
| Eingaben | Text | Text, JSON | Text, JSON, Bilder, Video | Text, JSON |
| Preis gehostet | keine gehostete API dokumentiert | 0,042 USD pro 1M Input | 0,09 USD pro 1M Input | keine gehostete API |
| EU-Residenz | per Self-Hosting | nicht dokumentiert | per Self-Hosting | per Self-Hosting |
Julia-1 ist das kleinste und am einfachsten zu betreibende Modell dieser Gruppe mit mehrsprachigem Encoder. Es ersetzt kein LLM und kein größeres Entscheidungsmodell; die Vergleichswerte stammen vom Hersteller.
Unsere Empfehlung
Für Unternehmen im DACH-Raum ist Julia-1 interessant als sehr kleines, selbst gehostetes Entscheidungsmodell für Routing, Triage und Vorfilterung, bei dem Daten auf der eigenen Infrastruktur bleiben. Prüfen Sie vor dem Einsatz die Genauigkeit auf Ihren deutschen Daten (die Modellkarte weist keine deutschen Einzelwerte aus), den Umgang mit langen Labellisten und die Reife einer Community-Veröffentlichung eines jungen Anbieters. Als Vorstufe zu Sprachmodellen in CompanyGPT oder als Router im AI Gateway prüfen wir den Einsatz projektbezogen. Für eine Einschätzung, ob ein Entscheidungsmodell in Ihre Architektur passt, kontaktieren Sie innFactory AI Consulting.
Verwandte Entscheidungsmodelle
Zur Kategorie der Entscheidungsmodelle (System One) gehören auch Microsoft-Decision-1, Cloudflare Clef, Laya, Jev, GLiNER2.5-Decide. Auch OpenAI geht mit der Decisions API auf Basis von GPT-6 Luna in diese Richtung; Details stehen auf der Seite OpenAI GPT.
