innFactory AI Consulting aus Rosenheim nimmt Kolibri-1 auf, weil Aleph Alpha damit erstmals ein eigenes Sprachmodell unter Apache 2.0 veröffentlicht (Pharia-1 und T-Free stehen unter der nicht-kommerziellen Open Aleph License), und zwar eines, das in der Klasse der sparsamen Mixture-of-Experts-Modelle gezielt für Deutsch gebaut ist. Grundlage dieser Seite sind die Modellkarte auf Hugging Face, der Tech Report, der Ankündigungsbeitrag von Aleph Alpha sowie Medienberichte zum Launch. Stand dieser Übersicht: Oktober 2026.
Was ist Kolibri-1?
Am 3. Oktober 2026 hat Aleph Alpha Research Kolibri-1 veröffentlicht: einen deutsch-englischen Mixture-of-Experts-Transformer mit 78,1 Milliarden Parametern, von denen pro Token 3,46 Milliarden (4,4 Prozent) aktiv sind. Das Modell ist laut Tech Report für Organisationen gebaut, die sensible Daten unter Regulierung verarbeiten und ihre Modelle deshalb auf eigener Infrastruktur betreiben müssen: öffentliche Verwaltung, Industrie, Luft- und Raumfahrt. Die Gewichte stehen unter Apache 2.0 auf Hugging Face.
| Kolibri-1 | |
|---|---|
| Architektur | MoE, 50 Schichten, 384 Experten + 1 gemeinsamer Experte, 6 aktiv |
| Parameter | 78,1 Mrd. gesamt, 3,46 Mrd. aktiv |
| Kontext | 1.048.576 Token (nativ 262.144) |
| Attention | Sliding Window 512 Token, volle Attention in jeder 5. Schicht; 48 Query-/4 KV-Heads |
| Tokenizer | UniBPE, 128.000 Einträge |
| Sprachen | Deutsch, Englisch |
| Reasoning | none, low, medium, high |
| Gewichte | FP8 (Kolibri-1), BF16 (Kolibri-1-BF16) |
| Knowledge Cutoff | 18. Juni 2026 |
| Lizenz | Apache 2.0 |
Kolibri-1 ist eine Neuentwicklung, kein Nachfolger im Pharia- oder Luminous-Stack: Die Modellkarte nennt weder Pharia noch die T-Free-Architektur, der Tech Report beschreibt ein von Grund auf trainiertes Modell. Vorläufer war ein internes Modell namens Kolibri Origin (30,6 Milliarden Parameter, 3,27 Milliarden aktiv), mit dem Aleph Alpha die Pipeline validiert hat; es wurde nicht veröffentlicht.
Training: 24 Billionen Token, über 20 Prozent Deutsch
Laut Tech Report umfasst das Training rund 24 Billionen Token: 20 Billionen Pre-Training, 3,44 Billionen Mid-Training und rund 200 Milliarden für die Kontextverlängerung auf 256k Token. Der Deutsch-Anteil liegt bei 21,3 Prozent des Pre-Trainings; dafür hat Aleph Alpha mehr als 2 Billionen deutsche Token selbst aus dem Web kuratiert und synthetisch erzeugt. Englisch macht rund 62 Prozent aus, Code rund 14 Prozent.
Das Pre-Training lief auf 768 NVIDIA B200 in 96 Knoten über 21 Tage (rund 392.000 GPU-Stunden) auf Infrastruktur in Deutschland und Finnland; die Modellkarte schätzt den Energieverbrauch auf rund 950 MWh inklusive Rechenzentrums-Overhead. Post-Training kombiniert Supervised Fine-Tuning auf kuratierten deutschen und englischen Daten mit Reinforcement Learning, unter anderem in Retrieval- und Code-Umgebungen.
Der UniBPE-Tokenizer mit 128.000 Einträgen ist zweisprachig ausgelegt. Aleph Alpha gibt im Blog rund 4,9 Byte pro Token auf deutschem Webtext (FineWeb-2) und 4,58 Byte pro Token auf Englisch (FineWeb) an. Für deutsche Komposita heißt das weniger Fragmentierung und damit weniger Token pro Dokument als bei englisch-zentrierten Tokenizern; die konkrete Ersparnis hängt vom Textkorpus ab.
Benchmarks: Aleph Alphas Angaben
Aleph Alpha vergleicht Kolibri-1 im Tech Report (Tabellen 28 und 29) mit offenen MoE-Modellen derselben Klasse, also rund 3 bis 6 Milliarden aktive Parameter. Es sind Herstellerangaben, alle Modelle wurden von Aleph Alpha in derselben Umgebung gemessen.
| Benchmark | Kolibri-1 | Qwen3.5 35B-A3B | Qwen3.6 35B-A3B | Gemma 4 26B-A4B | Nemotron 3 Nano 30B-A3B |
|---|---|---|---|---|---|
| Gesamt (EN) | 75,5 | 74,7 | 71,4 | 71,9 | 65,6 |
| Gesamt (DE) | 70,8 | 69,8 | 67,3 | 66,3 | 59,3 |
| GPQA Diamond (DE) | 81,3 | 84,2 | 80,6 | 80,1 | 49,6 |
| MMLU-ProX CoT (DE) | 75,5 | 81,7 | 81,9 | 81,1 | 61,0 |
| AIME 2025 (DE) | 87,5 | 76,7 | 82,9 | 88,1 | 84,4 |
| LiveCodeBench v6 | 85,9 | 77,8 | 82,5 | 82,3 | 71,3 |
| SWE-Bench Verified | 66,4 | 71,6 | 73,8 | 57,8 | 38,6 |
| Tau2-Bench Telecom | 94,7 | 97,7 | 99,1 | 45,3 | 45,9 |
| BFCL v4 (gesamt) | 61,4 | 70,5 | 67,2 | 68,2 | 61,5 |
| BFCL v3 (multi-turn) | 39,8 | 54,0 | 53,5 | 53,4 | 47,9 |
| RGB Closed-Book | 51,0 | 81,0 | 79,0 | 79,0 | 80,0 |
| AA-Omniscience Non-Hallucination | 44,0 | 11,1 | 56,7 | 14,3 | 19,0 |
| Industry RAG (DE) | 67,5 | 70,0 | 65,8 | 49,4 | 46,1 |
Drei Beobachtungen. Erstens liegt Kolibri-1 bei den Gesamtwerten in beiden Sprachen knapp vor den Vergleichsmodellen seiner Klasse, mit dem größten Abstand auf Deutsch. Zweitens sind Mathematik, Code und Retrieval-gestützte Aufgaben die Stärken: AIME 2025 auf Englisch 96,9, Honeypot 80,8, Industry RAG auf Englisch 89,7. Drittens zeigen die Werte für geschlossenes Faktenwissen (RGB Closed-Book 51,0) und mehrstufiges Tool-Calling (BFCL v3 multi-turn 39,8, TerminalBench 2.1 27,7) deutliche Lücken; Aleph Alpha selbst positioniert das Modell für den Einsatz mit Retrieval und beschreibt, dass es bei fehlender Kontextgrundlage abstiniert statt zu raten. Die hohe Non-Hallucination-Rate von 44,0 auf AA-Omniscience passt zu dieser Auslegung: Das Modell antwortet seltener falsch, weil es häufiger gar nicht antwortet.
Für den langen Kontext nennt die Modellkarte für das Basismodell auf RULER 63,2 bei 1 Million Token (Qwen3.5 35B: 57,5), aber 69,8 bei 256k gegenüber 80,1 für Qwen; die Modellkarte empfiehlt aus Effizienzgründen Eingaben bis 262.144 Token.
Betrieb: Hardware und vLLM
Kolibri-1 ist auf Self-Hosting ausgelegt. Die FP8-Gewichte belegen rund 78 GB; Embeddings, LM-Head, Normierungen und MoE-Router liegen in BF16, der KV-Cache in FP8.
| GPUs | |
|---|---|
| Minimum (Modellkarte) | 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 oder 1× B300 |
| Empfohlen (Modellkarte) | 2× H100 SXM5, 2× H200, 1× B200 oder 1× B300 |
| Gleichzeitige 256k-Anfragen in FP8 (Tech Report, Tabelle 31) | 2× H100: ~18, 4× H100: ~67, 1× B200: ~31, 2× B300: ~157 |
Der Start läuft über vLLM mit dem Plugin von Aleph Alpha:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choiceAlternativ gibt es ein Container-Image unter ghcr.io/aleph-alpha/aleph-alpha-inference. Die Modellkarte empfiehlt Temperatur 1,0, top-p 0,97 und top-k 128. Der Server ist OpenAI-kompatibel, sodass sich Kolibri-1 wie andere selbst gehostete Modelle als Backend in CompanyGPT oder hinter dem AI Gateway betreiben lässt. Eine gehostete API von Aleph Alpha ist für Kolibri-1 derzeit nicht dokumentiert; die Modellkarte verweist für Deployment und Anpassung auf den Vertrieb. WirtschaftsWoche und weitere Medien berichten von geplanten Angeboten auf STACKIT gemeinsam mit der Schwarz-Gruppe.
Datenschutz, Regulierung und Souveränität
Aleph Alpha beschreibt im Tech Report eine Entwicklungspipeline, die EU AI Act, den Verhaltenskodex für Allzweck-KI (GPAI Code of Practice) und die DSGVO von Beginn an berücksichtigt: Die Datenpipeline filtert gegen illegale, schädliche und raubkopierte Inhalte und entfernt personenbezogene Daten aus den Quellen; das Modell soll bei fehlender Kontextgrundlage abstinieren. Die Modellkarte listet zudem Einschränkungen (systemische Verzerrungen aus den Trainingsdaten, veraltetes Wissen ab Juni 2026, Halluzinationen) und empfiehlt Prompt-Design, Validierung auf Anwendungsebene, Ausgabefilter und Red-Teaming; für unbeaufsichtigte Entscheidungen mit hohem Risiko wird das Modell nicht empfohlen.
Für die Souveränitätsfrage zählt vor allem der Betriebsweg: Mit offenen Gewichten auf eigener Hardware verlassen weder Prompts noch Dokumente das eigene Haus. Das unterscheidet Kolibri-1 von gehosteten Modellen wie OpenAI GPT oder Anthropic Claude, bei denen EU-Datenresidenz über Cloud-Deployments wie Microsoft Foundry oder Bedrock hergestellt wird. Das Training selbst fand laut Aleph Alpha in Deutschland und Finnland statt.
Einordnung: Kolibri-1, Pharia, Mistral und OpenEuroLLM
| Kolibri-1 | Pharia-1 LLM-7B | Mistral (offene Modelle) | OpenEuroLLM | |
|---|---|---|---|---|
| Hersteller | Aleph Alpha (Heidelberg) | Aleph Alpha | Mistral AI (Paris) | EU-Konsortium |
| Architektur | MoE 78,1B / 3,46B aktiv | dense 7B | dense und MoE, je nach Modell | in Entwicklung |
| Kontext | 1M Token | 8k Token | je nach Modell | – |
| Sprachen | Deutsch, Englisch | mehrsprachig (7 EU-Sprachen) | mehrsprachig | alle EU-Sprachen (Ziel) |
| Lizenz | Apache 2.0 | Open Aleph License (nicht-kommerziell) | Apache 2.0 (offene Modelle) | offen (Ziel) |
| Gehostete API | nicht dokumentiert | PhariaAI | Mistral La Plateforme, Azure, AWS u. a. | – |
Kolibri-1 ist das Modell für Organisationen, die Deutsch als Hauptsprache, einen langen Kontext und den Betrieb auf eigener Hardware brauchen und dafür auf Bild-Eingabe und weitere Sprachen verzichten können. Wer eine breite Sprachabdeckung oder eine gehostete API sucht, ist bei Mistral besser aufgehoben; wer auf eine konsortiale EU-Lösung wartet, beobachtet OpenEuroLLM.
Unsere Empfehlung
Für Behörden, Industrieunternehmen und regulierte Branchen im DACH-Raum ist Kolibri-1 ein Kandidat für die Shortlist selbst gehosteter Modelle: offene Lizenz, deutsche Sprachqualität in der eigenen Klasse, 1 Million Token Kontext, Reasoning-Stufen und ein Betriebspfad über vLLM, der mit zwei H100 oder einer B200 auskommt. Prüfen Sie vor dem Einsatz drei Punkte: die Qualität bei mehrstufigem Tool-Calling (hier liegt das Modell unter den Vergleichsmodellen), den Umgang mit Faktenfragen ohne Retrieval (das Modell ist auf RAG ausgelegt) und die Betriebskosten der GPU-Infrastruktur gegenüber einem EU-Cloud-Deployment eines gehosteten Modells. Für das bestehende Aleph-Alpha-Portfolio gilt: Kolibri-1 löst Pharia-1 LLM-7B als unsere Empfehlung ab.
Wir evaluieren Kolibri-1 projektbezogen als Backend für CompanyGPT und als Modell hinter dem AI Gateway. Für eine Einschätzung, ob Kolibri-1 zu Ihren Anforderungen passt, kontaktieren Sie innFactory AI Consulting.
