↓ Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM Aleph Alpha Deutschland

Aleph Alpha Kolibri-1

Kolibri-1 von Aleph Alpha: offenes deutsch-englisches MoE-Modell (78,1 Mrd. Parameter, 1 Mio. Token, Apache 2.0) für Self-Hosting mit vLLM, Hardware und DSGVO.

Lizenz Apache 2.0
DSGVO-Hosting Verfügbar
Kontext 1048576 Tokens
Modalität Text → Text

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Kolibri-1 (Aleph-Alpha/Kolibri-1, FP8) Empfohlen
3. Oktober 2026
Deutsch-englischer Mixture-of-Experts-Transformer: 78,1 Mrd. Parameter, 3,46 Mrd. aktiv pro Token, 50 MoE-Schichten mit 384 Experten plus einem gemeinsamen Experten, 6 aktive Experten Kontext bis 1.048.576 Token (nativ trainiert bis 262.144), hybride Aufmerksamkeit aus Sliding Window (512 Token) und voller Attention in jeder fünften Schicht; Knowledge Cutoff 18. Juni 2026 Reasoning in vier Stufen (none, low, medium, high), Tool-Calling mit strukturierter Ausgabe, vLLM-Parser für Reasoning und Tool-Calls im Paket aleph-alpha-inference Laut Tech Report Gesamtwert 75,5 (EN) und 70,8 (DE); GPQA Diamond 84,3 (EN) / 81,3 (DE), AIME 2025 96,9 (EN), LiveCodeBench v6 85,9, Tau2-Bench Telecom 94,7, Honeypot 80,8 Trainiert auf rund 24 Billionen Token mit über 20 % Deutsch-Anteil, auf 768 NVIDIA B200 in Deutschland und Finnland; UniBPE-Tokenizer mit 128.000 Einträgen für deutsche Komposita Entwickelt laut Aleph Alpha mit Blick auf EU AI Act, GPAI-Verhaltenskodex und DSGVO: Filterung illegaler und raubkopierter Inhalte, Entfernung personenbezogener Daten, Abstinenz bei fehlender Kontextgrundlage Apache 2.0, FP8-Gewichte rund 78 GB, FP8-KV-Cache; laut Tech Report rund 18 gleichzeitige 256k-Anfragen auf zwei H100
Nur Text, keine Bild- oder Audioeingabe; nur Deutsch und Englisch als Zielsprachen Geschlossenes Faktenwissen schwächer als vergleichbare Modelle: RGB Closed-Book 51,0 (Vergleichsmodelle 78 bis 89), AA-Omniscience Accuracy 14,8 (Tech Report); Aleph Alpha empfiehlt den Einsatz mit Retrieval Mehrstufiges Tool-Calling unter dem Klassenschnitt: BFCL v3 multi-turn 39,8 (Qwen3.5 35B-A3B 54,0, Nemotron 3 Nano 58,2); TerminalBench 2.1 27,7 gegenüber 39,7 bei Qwen3.5 35B-A3B Mindestens zwei 80-GB-GPUs oder eine H200/B200 nötig; Betrieb setzt vLLM mit dem Kolibri-Plugin voraus, zum Start kein Angebot bei Azure, AWS oder Google dokumentiert Alle Benchmarks stammen vom Hersteller; unabhängige Evaluationen lagen zum Start nicht vor Unternehmen befindet sich in der Fusion mit Cohere (Vereinbarung vom 16. September 2026, Vollzug ausstehend); Roadmap für weitere Kolibri-Größen nicht veröffentlicht
Aktuell
Kolibri-1-BF16 (Aleph-Alpha/Kolibri-1-BF16)
3. Oktober 2026
Volle BF16-Präzision für eigenes Fine-Tuning, Quantisierung oder Evaluation Gleiche Architektur und Lizenz wie Kolibri-1
Rund doppelter Speicherbedarf gegenüber den FP8-Gewichten Für den Produktivbetrieb empfiehlt die Modellkarte die FP8-Variante mit FP8-KV-Cache
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Öffentliche Verwaltung und Behörden
Industrie, Luft- und Raumfahrt, Automobilzulieferer
Retrieval-Augmented Generation über interne Dokumente
Agentische Workflows mit Tool-Calling
Dokumentenverarbeitung und Entwurfserstellung auf Deutsch
Interne Wissens- und Recherchewerkzeuge

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Open Weights (Hugging Face); Self-Hosting mit vLLM über das Paket aleph-alpha-inference (OpenAI-kompatibler Server), Container ghcr.io/aleph-alpha/aleph-alpha-inference; keine gehostete API dokumentiert
Latenz (TTFT) abhängig von eigener Hardware
Features & Capabilities
Tool Use Function Calling Structured Output Reasoning Mode
Training & Wissen
Wissensstand 18. Juni 2026
Fine-Tuning Verfügbar (Eigenes Fine-Tuning der offenen Gewichte (BF16-Variante verfügbar), Anpassung und Betrieb mit Aleph Alpha (laut Modellkarte auf Anfrage))
Sprachunterstützung
Beste Qualität Deutsch, Englisch
Unterstützt 2 Sprachen (Deutsch, Englisch)
Zweisprachig trainiert mit über 20 % deutschem Anteil; Tokenizer laut Aleph Alpha rund 4,9 Byte pro Token auf deutschem Webtext (FineWeb-2)

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene Infrastruktur oder EU-Cloud
Vorgesehener Betriebsweg: Apache-2.0-Gewichte mit vLLM (aleph-alpha-inference), rund 78 GB GPU-Speicher in FP8; keine Daten an Dritte
STACKIT (Schwarz Digits)
Deutschland / Österreich
Laut Medienberichten zum Launch sind Angebote auf Basis von Kolibri auf STACKIT geplant; derzeit ist kein Produkt dokumentiert
Lizenz & Hosting
Lizenz Apache 2.0
Sicherheitsfilter Modellseitig (Abstinenz bei fehlender Kontextgrundlage, Sicherheits-Alignment); zusätzliche Filter auf Anwendungsebene empfohlen
Enterprise Support Ja
On-Premise

Benchmarks

Leistungsvergleich mit standardisierten Tests

Gesamtwert Deutsch (Tech Report, Aleph-Alpha-Angabe)
70.8
Gesamtwert Englisch (Tech Report, Aleph-Alpha-Angabe)
75.5
GPQA Diamond Deutsch (Aleph-Alpha-Angabe)
81.3
AIME 2025 Englisch (Aleph-Alpha-Angabe)
96.9
LiveCodeBench v6 (Aleph-Alpha-Angabe)
85.9
RULER bei 1M Token, Basismodell (Aleph-Alpha-Angabe)
63.2

innFactory AI Consulting aus Rosenheim nimmt Kolibri-1 auf, weil Aleph Alpha damit erstmals ein eigenes Sprachmodell unter Apache 2.0 veröffentlicht (Pharia-1 und T-Free stehen unter der nicht-kommerziellen Open Aleph License), und zwar eines, das in der Klasse der sparsamen Mixture-of-Experts-Modelle gezielt für Deutsch gebaut ist. Grundlage dieser Seite sind die Modellkarte auf Hugging Face, der Tech Report, der Ankündigungsbeitrag von Aleph Alpha sowie Medienberichte zum Launch. Stand dieser Übersicht: Oktober 2026.

Was ist Kolibri-1?

Am 3. Oktober 2026 hat Aleph Alpha Research Kolibri-1 veröffentlicht: einen deutsch-englischen Mixture-of-Experts-Transformer mit 78,1 Milliarden Parametern, von denen pro Token 3,46 Milliarden (4,4 Prozent) aktiv sind. Das Modell ist laut Tech Report für Organisationen gebaut, die sensible Daten unter Regulierung verarbeiten und ihre Modelle deshalb auf eigener Infrastruktur betreiben müssen: öffentliche Verwaltung, Industrie, Luft- und Raumfahrt. Die Gewichte stehen unter Apache 2.0 auf Hugging Face.

Kolibri-1
ArchitekturMoE, 50 Schichten, 384 Experten + 1 gemeinsamer Experte, 6 aktiv
Parameter78,1 Mrd. gesamt, 3,46 Mrd. aktiv
Kontext1.048.576 Token (nativ 262.144)
AttentionSliding Window 512 Token, volle Attention in jeder 5. Schicht; 48 Query-/4 KV-Heads
TokenizerUniBPE, 128.000 Einträge
SprachenDeutsch, Englisch
Reasoningnone, low, medium, high
GewichteFP8 (Kolibri-1), BF16 (Kolibri-1-BF16)
Knowledge Cutoff18. Juni 2026
LizenzApache 2.0

Kolibri-1 ist eine Neuentwicklung, kein Nachfolger im Pharia- oder Luminous-Stack: Die Modellkarte nennt weder Pharia noch die T-Free-Architektur, der Tech Report beschreibt ein von Grund auf trainiertes Modell. Vorläufer war ein internes Modell namens Kolibri Origin (30,6 Milliarden Parameter, 3,27 Milliarden aktiv), mit dem Aleph Alpha die Pipeline validiert hat; es wurde nicht veröffentlicht.

Training: 24 Billionen Token, über 20 Prozent Deutsch

Laut Tech Report umfasst das Training rund 24 Billionen Token: 20 Billionen Pre-Training, 3,44 Billionen Mid-Training und rund 200 Milliarden für die Kontextverlängerung auf 256k Token. Der Deutsch-Anteil liegt bei 21,3 Prozent des Pre-Trainings; dafür hat Aleph Alpha mehr als 2 Billionen deutsche Token selbst aus dem Web kuratiert und synthetisch erzeugt. Englisch macht rund 62 Prozent aus, Code rund 14 Prozent.

Das Pre-Training lief auf 768 NVIDIA B200 in 96 Knoten über 21 Tage (rund 392.000 GPU-Stunden) auf Infrastruktur in Deutschland und Finnland; die Modellkarte schätzt den Energieverbrauch auf rund 950 MWh inklusive Rechenzentrums-Overhead. Post-Training kombiniert Supervised Fine-Tuning auf kuratierten deutschen und englischen Daten mit Reinforcement Learning, unter anderem in Retrieval- und Code-Umgebungen.

Der UniBPE-Tokenizer mit 128.000 Einträgen ist zweisprachig ausgelegt. Aleph Alpha gibt im Blog rund 4,9 Byte pro Token auf deutschem Webtext (FineWeb-2) und 4,58 Byte pro Token auf Englisch (FineWeb) an. Für deutsche Komposita heißt das weniger Fragmentierung und damit weniger Token pro Dokument als bei englisch-zentrierten Tokenizern; die konkrete Ersparnis hängt vom Textkorpus ab.

Benchmarks: Aleph Alphas Angaben

Aleph Alpha vergleicht Kolibri-1 im Tech Report (Tabellen 28 und 29) mit offenen MoE-Modellen derselben Klasse, also rund 3 bis 6 Milliarden aktive Parameter. Es sind Herstellerangaben, alle Modelle wurden von Aleph Alpha in derselben Umgebung gemessen.

BenchmarkKolibri-1Qwen3.5 35B-A3BQwen3.6 35B-A3BGemma 4 26B-A4BNemotron 3 Nano 30B-A3B
Gesamt (EN)75,574,771,471,965,6
Gesamt (DE)70,869,867,366,359,3
GPQA Diamond (DE)81,384,280,680,149,6
MMLU-ProX CoT (DE)75,581,781,981,161,0
AIME 2025 (DE)87,576,782,988,184,4
LiveCodeBench v685,977,882,582,371,3
SWE-Bench Verified66,471,673,857,838,6
Tau2-Bench Telecom94,797,799,145,345,9
BFCL v4 (gesamt)61,470,567,268,261,5
BFCL v3 (multi-turn)39,854,053,553,447,9
RGB Closed-Book51,081,079,079,080,0
AA-Omniscience Non-Hallucination44,011,156,714,319,0
Industry RAG (DE)67,570,065,849,446,1

Drei Beobachtungen. Erstens liegt Kolibri-1 bei den Gesamtwerten in beiden Sprachen knapp vor den Vergleichsmodellen seiner Klasse, mit dem größten Abstand auf Deutsch. Zweitens sind Mathematik, Code und Retrieval-gestützte Aufgaben die Stärken: AIME 2025 auf Englisch 96,9, Honeypot 80,8, Industry RAG auf Englisch 89,7. Drittens zeigen die Werte für geschlossenes Faktenwissen (RGB Closed-Book 51,0) und mehrstufiges Tool-Calling (BFCL v3 multi-turn 39,8, TerminalBench 2.1 27,7) deutliche Lücken; Aleph Alpha selbst positioniert das Modell für den Einsatz mit Retrieval und beschreibt, dass es bei fehlender Kontextgrundlage abstiniert statt zu raten. Die hohe Non-Hallucination-Rate von 44,0 auf AA-Omniscience passt zu dieser Auslegung: Das Modell antwortet seltener falsch, weil es häufiger gar nicht antwortet.

Für den langen Kontext nennt die Modellkarte für das Basismodell auf RULER 63,2 bei 1 Million Token (Qwen3.5 35B: 57,5), aber 69,8 bei 256k gegenüber 80,1 für Qwen; die Modellkarte empfiehlt aus Effizienzgründen Eingaben bis 262.144 Token.

Betrieb: Hardware und vLLM

Kolibri-1 ist auf Self-Hosting ausgelegt. Die FP8-Gewichte belegen rund 78 GB; Embeddings, LM-Head, Normierungen und MoE-Router liegen in BF16, der KV-Cache in FP8.

GPUs
Minimum (Modellkarte)2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 oder 1× B300
Empfohlen (Modellkarte)2× H100 SXM5, 2× H200, 1× B200 oder 1× B300
Gleichzeitige 256k-Anfragen in FP8 (Tech Report, Tabelle 31)2× H100: ~18, 4× H100: ~67, 1× B200: ~31, 2× B300: ~157

Der Start läuft über vLLM mit dem Plugin von Aleph Alpha:

pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Alternativ gibt es ein Container-Image unter ghcr.io/aleph-alpha/aleph-alpha-inference. Die Modellkarte empfiehlt Temperatur 1,0, top-p 0,97 und top-k 128. Der Server ist OpenAI-kompatibel, sodass sich Kolibri-1 wie andere selbst gehostete Modelle als Backend in CompanyGPT oder hinter dem AI Gateway betreiben lässt. Eine gehostete API von Aleph Alpha ist für Kolibri-1 derzeit nicht dokumentiert; die Modellkarte verweist für Deployment und Anpassung auf den Vertrieb. WirtschaftsWoche und weitere Medien berichten von geplanten Angeboten auf STACKIT gemeinsam mit der Schwarz-Gruppe.

Datenschutz, Regulierung und Souveränität

Aleph Alpha beschreibt im Tech Report eine Entwicklungspipeline, die EU AI Act, den Verhaltenskodex für Allzweck-KI (GPAI Code of Practice) und die DSGVO von Beginn an berücksichtigt: Die Datenpipeline filtert gegen illegale, schädliche und raubkopierte Inhalte und entfernt personenbezogene Daten aus den Quellen; das Modell soll bei fehlender Kontextgrundlage abstinieren. Die Modellkarte listet zudem Einschränkungen (systemische Verzerrungen aus den Trainingsdaten, veraltetes Wissen ab Juni 2026, Halluzinationen) und empfiehlt Prompt-Design, Validierung auf Anwendungsebene, Ausgabefilter und Red-Teaming; für unbeaufsichtigte Entscheidungen mit hohem Risiko wird das Modell nicht empfohlen.

Für die Souveränitätsfrage zählt vor allem der Betriebsweg: Mit offenen Gewichten auf eigener Hardware verlassen weder Prompts noch Dokumente das eigene Haus. Das unterscheidet Kolibri-1 von gehosteten Modellen wie OpenAI GPT oder Anthropic Claude, bei denen EU-Datenresidenz über Cloud-Deployments wie Microsoft Foundry oder Bedrock hergestellt wird. Das Training selbst fand laut Aleph Alpha in Deutschland und Finnland statt.

Einordnung: Kolibri-1, Pharia, Mistral und OpenEuroLLM

Kolibri-1Pharia-1 LLM-7BMistral (offene Modelle)OpenEuroLLM
HerstellerAleph Alpha (Heidelberg)Aleph AlphaMistral AI (Paris)EU-Konsortium
ArchitekturMoE 78,1B / 3,46B aktivdense 7Bdense und MoE, je nach Modellin Entwicklung
Kontext1M Token8k Tokenje nach Modell–
SprachenDeutsch, Englischmehrsprachig (7 EU-Sprachen)mehrsprachigalle EU-Sprachen (Ziel)
LizenzApache 2.0Open Aleph License (nicht-kommerziell)Apache 2.0 (offene Modelle)offen (Ziel)
Gehostete APInicht dokumentiertPhariaAIMistral La Plateforme, Azure, AWS u. a.–

Kolibri-1 ist das Modell für Organisationen, die Deutsch als Hauptsprache, einen langen Kontext und den Betrieb auf eigener Hardware brauchen und dafür auf Bild-Eingabe und weitere Sprachen verzichten können. Wer eine breite Sprachabdeckung oder eine gehostete API sucht, ist bei Mistral besser aufgehoben; wer auf eine konsortiale EU-Lösung wartet, beobachtet OpenEuroLLM.

Unsere Empfehlung

Für Behörden, Industrieunternehmen und regulierte Branchen im DACH-Raum ist Kolibri-1 ein Kandidat für die Shortlist selbst gehosteter Modelle: offene Lizenz, deutsche Sprachqualität in der eigenen Klasse, 1 Million Token Kontext, Reasoning-Stufen und ein Betriebspfad über vLLM, der mit zwei H100 oder einer B200 auskommt. Prüfen Sie vor dem Einsatz drei Punkte: die Qualität bei mehrstufigem Tool-Calling (hier liegt das Modell unter den Vergleichsmodellen), den Umgang mit Faktenfragen ohne Retrieval (das Modell ist auf RAG ausgelegt) und die Betriebskosten der GPU-Infrastruktur gegenüber einem EU-Cloud-Deployment eines gehosteten Modells. Für das bestehende Aleph-Alpha-Portfolio gilt: Kolibri-1 löst Pharia-1 LLM-7B als unsere Empfehlung ab.

Wir evaluieren Kolibri-1 projektbezogen als Backend für CompanyGPT und als Modell hinter dem AI Gateway. Für eine Einschätzung, ob Kolibri-1 zu Ihren Anforderungen passt, kontaktieren Sie innFactory AI Consulting.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Häufig gestellte Fragen

Was ist Aleph Alpha Kolibri-1?

Kolibri-1 ist ein am 3. Oktober 2026 von Aleph Alpha Research veröffentlichtes Sprachmodell für Deutsch und Englisch. Es ist ein Mixture-of-Experts-Transformer mit 78,1 Milliarden Parametern, von denen 3,46 Milliarden pro Token aktiv sind, verarbeitet Kontexte bis 1.048.576 Token, unterstützt Reasoning in vier Stufen (none, low, medium, high) sowie Tool-Calling und steht unter Apache 2.0 auf Hugging Face. Laut Aleph Alpha wurde es von Grund auf in Deutschland entwickelt und auf Infrastruktur in Deutschland und Finnland trainiert, mit Blick auf EU AI Act, den GPAI-Verhaltenskodex und die DSGVO.

Welche Hardware braucht Kolibri-1?

Die FP8-Gewichte belegen rund 78 GB. Als Minimum nennt die Modellkarte zwei A100 mit 80 GB, zwei H100 SXM5, eine H200, eine B200 oder eine B300; empfohlen werden zwei H100 SXM5, zwei H200, eine B200 oder eine B300. Der Betrieb läuft über vLLM mit dem Paket aleph-alpha-inference, das Reasoning- und Tool-Call-Parser für Kolibri mitbringt. Laut Tech Report passen in FP8 auf zwei H100 etwa 18 gleichzeitige Anfragen mit 256k Token, auf eine B200 etwa 31.

Wie gut ist Kolibri-1 auf Deutsch?

Aleph Alpha misst im Tech Report einen Gesamtwert von 70,8 Punkten auf deutschen Benchmarks (Englisch: 75,5). In der Klasse der MoE-Modelle mit rund 3 Milliarden aktiven Parametern liegt Kolibri damit vor Qwen3.5 35B-A3B (69,8), Qwen3.6 35B-A3B (67,3), Gemma 4 26B-A4B (66,3) und Nemotron 3 Nano 30B-A3B (59,3). Einzelwerte: GPQA Diamond auf Deutsch 81,3, MMLU-ProX 75,5, AIME 2025 auf Deutsch 87,5. Die Zahlen stammen vom Hersteller; unabhängige Messungen lagen zum Start nicht vor.

Ist Kolibri-1 DSGVO-konform nutzbar?

Kolibri-1 ist für den Betrieb auf eigener Infrastruktur gebaut: Die Apache-2.0-Gewichte lassen sich im eigenen Rechenzentrum oder bei einem EU-Cloud-Anbieter mit vLLM betreiben, sodass keine Daten an einen Modellanbieter fließen. Laut Aleph Alpha filtert die Datenpipeline illegale, schädliche und raubkopierte Inhalte und entfernt personenbezogene Daten aus den Trainingsquellen. Eine gehostete API von Aleph Alpha für Kolibri-1 ist derzeit nicht dokumentiert; Medienberichte nennen geplante Angebote auf STACKIT zusammen mit der Schwarz-Gruppe.

Was unterscheidet Kolibri-1 von Pharia und Luminous?

Luminous und Pharia-1 waren die früheren Modellgenerationen von Aleph Alpha; Pharia-1 LLM-7B ist ein dichtes 7-Milliarden-Modell mit 8k Kontext unter der nicht-kommerziellen Open Aleph License. Kolibri-1 ist eine Neuentwicklung: Mixture-of-Experts mit 78,1 Milliarden Gesamtparametern, 1 Million Token Kontext, Reasoning-Stufen, Tool-Calling und ein neuer UniBPE-Tokenizer mit 128.000 Einträgen. Die Modellkarte nennt keinen Bezug zu Pharia oder zur T-Free-Architektur; Kolibri wurde laut Tech Report von Grund auf trainiert.

Was bedeutet die Cohere-Fusion für Kolibri-1?

Aleph Alpha und Cohere haben am 16. September 2026 eine definitive Fusionsvereinbarung unterzeichnet; der Vollzug steht laut Cohere noch aus. Kolibri-1 erscheint unter der Marke Aleph Alpha Research mit offener Apache-2.0-Lizenz, die unabhängig von Unternehmensstrukturen gilt. Laut Medienberichten sollen Angebote auf Basis von Kolibri Teil des gemeinsamen Sovereign-AI-Angebots auf STACKIT werden. Eine Roadmap zu weiteren Kolibri-Größen oder zur Verbindung mit Coheres Command-Modellen hat keines der Unternehmen veröffentlicht.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.