NVIDIA hat seine offene Modellfamilie Nemotron 3 mit den drei Reasoning-Größen Nano, Super und Ultra komplettiert und am 11. August 2026 mit Nemotron 3.5 Lightning um ein neues, auf lang laufende Agenten spezialisiertes Modell in der Nano-Größenklasse ergänzt. Mit dem Release von Nemotron 3 Ultra (550B) am 4. Juni 2026 steht zudem erstmals ein Frontier-Modell von NVIDIA mit offenen Gewichten zur Verfügung. Die meisten Modelle stehen unter der NVIDIA Open Model License, Nemotron 3 Ultra und Nemotron 3.5 Lightning laut ihren Modellkarten unter der OpenMDW-1.1-Lizenz – beide erlauben freies Herunterladen, Anpassen und kommerziellen Betrieb. innFactory AI Consulting aus Rosenheim berät zum DSGVO-konformen Einsatz. Stand dieser Übersicht: Oktober 2026.
Was ist NVIDIA Nemotron?
Nemotron ist NVIDIAs Familie offener Modelle (Open Weights), die speziell für agentische KI und Reasoning entwickelt wurde. Anders als rein proprietäre Modelle veröffentlicht NVIDIA Gewichte, Trainingsdaten und Trainingstechniken offen – so kann die Community die Modelle selbst betreiben, anpassen und für eigene Zwecke weitertrainieren. Die aktuelle Nemotron-3-Generation nutzt eine effiziente Hybrid Mamba-Transformer Mixture-of-Experts (MoE)-Architektur, bei der pro Anfrage nur ein Bruchteil der Parameter aktiv ist.
Aktuelle Modelle im Überblick
NVIDIA bietet drei Reasoning-Größen, die sich nach Aufgabenkomplexität und Hardware skalieren:
| Modell | Parameter (aktiv) | Kontext | Release | Lizenz |
|---|---|---|---|---|
| Nemotron 3 Nano | ca. 31,6B (3,6B) | 1M | 15. Dezember 2025 | NVIDIA Open Model License |
| Nemotron 3 Super | 120B (12B) | – | März 2026 (GTC) | NVIDIA Open Model License |
| Nemotron 3 Ultra | 550B (55B) | bis 1M | 4. Juni 2026 | OpenMDW-1.1 |
| Nemotron 3.5 Lightning | 30B (3B) | 1M | 11. August 2026 | OpenMDW-1.1 |
| Nemotron-3-Diarization | 100M | – | 23. September 2026 | OpenMDW-1.1 |
Nemotron 3 Nano (30B-A3B)
- ca. 31,6B Parameter gesamt, ca. 3,6B aktiv (Hybrid Mamba-Transformer MoE)
- 1M Token Kontextfenster
- Sehr effizient: bis zu 4x höherer Durchsatz als Nemotron Nano 2
- Self-hostbar auf moderater Hardware (vLLM, SGLang, LM Studio, llama.cpp, Ollama)
- Release: 15. Dezember 2025
Nemotron 3 Super (120B-A12B)
- 120B Parameter gesamt, ca. 12B aktiv (Hybrid Mamba-Transformer MoE)
- Starke agentische, Reasoning- und Tool-Calling-Fähigkeiten
- Optimiert für Multi-Agent-Systeme und hohe Durchsatzlasten (z. B. IT-Ticket-Automatisierung)
- Release: GTC, März 2026
Nemotron 3 Ultra (550B-A55B)
- 550B Parameter gesamt, ca. 55B aktiv (Hybrid LatentMoE: Mamba-2 + MoE + Attention, mit Multi-Token Prediction)
- Bis zu 1M Token Kontext für Langkontext-Analyse
- Frontier-Reasoning über Code, Mathematik und Wissenschaft
- Release: 4. Juni 2026 (Computex)
Nemotron 3.5 Lightning
Am 11. August 2026 hat NVIDIA mit Nemotron 3.5 Lightning ein Modell in der Größenklasse von Nemotron 3 Nano veröffentlicht:
- 30 Mrd. Parameter gesamt, ca. 3 Mrd. aktiv (Hybrid-Architektur aus Mamba-2, MoE und Attention-Layern)
- 1M Token Kontextfenster
- Laut NVIDIA bis zu 4x höhere Ausgabegeschwindigkeit und rund 30 % schnellere Aufgabenerledigung für Agenten
- Single-GPU-Deployment (1x DGX Spark/GB10 oder 1x H100), läuft auch auf einer RTX-5090-Workstation
- Open Weights, Trainingsdaten und Rezepte unter der OpenMDW-1.1-Lizenz (BF16- und NVFP4-Checkpoints), nicht unter der NVIDIA Open Model License
- Laut Modellkarte: MMLU Pro 81,9, GPQA Diamond (ohne Tools) 75,4
- Verfügbar über Hugging Face, ModelScope, OpenRouter und build.nvidia.com (NIM-Microservice)
NVIDIA positioniert Nemotron 3.5 Lightning für lang laufende autonome Agenten und als Sub-Agenten-Workhorse in Multi-Agent-Systemen. Das Modell ergänzt die Nano-Klasse, ersetzt Nemotron 3 Nano aber nicht offiziell – beide sind laut Hersteller weiterhin aktiv gelistet.
Nemotron-3-Diarization
Nemotron-3-Diarization (23. September 2026) ist ein 100M-Parameter-Modell zur Sprecher-Diarisierung unter OpenMDW 1.1: Es erkennt, wer wann spricht (bis zu acht Sprecher, Streaming und Offline, Latenz von 80 ms bis 30,4 s). Laut NVIDIA-Modellkarte liegt die DER auf DIHARD III bei 12,73 % (Vorgängermodell: 19,09 %). Es ergänzt Transkriptionsmodelle um die Sprecherzuordnung in Meetings und Call-Centern, identifiziert aber keine Personen und läuft auf eigener Infrastruktur (NeMo, Transformers oder C++-Runtime).
Weitere Modelle: NVIDIA pflegt zusätzlich Nemotron Nano Omni (multimodal, Vision/Audio/Sprache, 256K Kontext), Nemotron 3.5 ASR (600M-Parameter-Streaming-Spracherkennung für 40 Sprach-Locales, seit 4. Juni 2026), Nemotron 3.5 Content Safety (4B-Parameter-Sicherheitsmodell für Multimodal-Moderation), Retriever-/RAG-Modelle sowie OCR-Modelle. Die ältere Llama-Nemotron-Reihe (Nano 8B, Super 49B, Ultra 253B) basiert auf Llama 3.1 mit 128K Kontext.
Besondere Stärken
Effizienz durch Hybrid-MoE
Die Mamba-Transformer-MoE-Architektur aktiviert pro Token nur einen Bruchteil der Gesamtparameter. Das senkt Inferenzkosten deutlich – Nemotron 3 Nano erreicht laut NVIDIA bis zu 4x höheren Durchsatz als die Vorgängergeneration und reduziert die Anzahl der Reasoning-Tokens.
Agentic & Tool Use
Alle Nemotron-3-Modelle sind auf agentische Workflows ausgelegt: natives Tool Calling, Funktionsaufrufe und strukturierte Ausgaben für Multi-Agent-Systeme.
Open Weights & permissive Lizenz
Die NVIDIA Open Model License ist permissiv und erlaubt Nutzung, Modifikation, Weitergabe und kommerziellen Einsatz – ohne Namensnennungspflicht. NVIDIA veröffentlicht zusätzlich Trainingsdatensätze und Tools (NeMo Gym, NeMo RL, NeMo Evaluator).
Hinweis: Bei einzelnen Modellkarten auf Hugging Face werden teils abweichende Lizenzbezeichnungen (z. B. OpenMDW) geführt. Wir prüfen die konkrete Lizenz pro Modell und Version im Rahmen der Beratung.
EU-Verfügbarkeit & DSGVO-Konformität
Weil Nemotron als Open Weights veröffentlicht wird, ist der sauberste Souveränitätspfad das Self-Hosting auf EU-Infrastruktur – alle Daten bleiben unter Ihrer Kontrolle.
Self-Hosting (empfohlen für Souveränität)
- Betrieb auf eigener Hardware oder bei einem EU-Cloud-Anbieter (z. B. in Frankfurt)
- Volle DSGVO-Konformität, keine Abhängigkeit von US-APIs
- Nano lässt sich bereits auf moderater Hardware betreiben; Ultra benötigt mehrere High-End-GPUs (z. B. 8x B200/GB200, 16x H100 oder 8x H200)
Managed über Hyperscaler (EU-Regionen)
- AWS: Amazon Bedrock bietet Nemotron Nano 3 30B und Nemotron 3 Super 120B laut AWS In-Region in Irland (eu-west-1), Mailand (eu-south-1) und London (eu-west-2, UK). Bei Frankfurt (eu-central-1) und Stockholm (eu-north-1) widersprechen sich die AWS-Quellen: Die Modellkarten nennen beide Regionen für Nano 3 30B, die Regionsübersicht dagegen für Super 120B – vor einem Deployment daher in der Bedrock-Konsole prüfen. Nemotron 3 Ultra ist nicht auf Bedrock gelistet, sondern über Amazon SageMaker JumpStart verfügbar (Self-Managed-Endpunkt, Region frei wählbar, z. B. Frankfurt)
- Microsoft Foundry: Nemotron 3 Nano und Super laufen als NIM-Microservice auf Managed Compute – die Azure-Region mit passender GPU-Kapazität (z. B. West Europe) wählt der Kunde selbst; anders als bei den MAI-Modellen handelt es sich nicht um ein Serverless-/Global-Standard-Angebot
- Google: Gemini Enterprise Agent Platform (vormals Vertex AI – Rebrand im April 2026 auf der Cloud Next) im Model Garden – konkrete EU-Regionen für Nemotron dort nicht abschließend verifiziert
Direkt über NVIDIA
- build.nvidia.com und NVIDIA NIM Microservices für gehostete Endpunkte bzw. containerisierte Self-Service-Deployments
- Hosted-Inferenz auch über Anbieter wie Together AI, Fireworks, DeepInfra, OpenRouter, Baseten
Für sensible Daten empfehlen wir Self-Hosting in der EU. Für schnellen Start eignen sich EU-Regionen der Hyperscaler oder NIM-Container in eigener Cloud-Umgebung.
Integration mit CompanyGPT
Dank Open Weights lässt sich Nemotron gut in unsere DSGVO-konforme Lösung CompanyGPT integrieren. So können Sie ein leistungsstarkes Reasoning- und Agenten-Modell vollständig in Ihrer eigenen oder einer EU-gehosteten Umgebung betreiben – ohne dass Unternehmensdaten in Drittländer abfließen. innFactory AI Consulting übernimmt Auswahl, Deployment und Feintuning des passenden Nemotron-Modells.
Unsere Empfehlung
Nemotron ist eine offene Modellfamilie für agentische und Reasoning-Anwendungen – und durch die Open Weights gut geeignet für souveräne, DSGVO-konforme Deployments.
Für die meisten Unternehmen empfehlen wir:
- Nemotron 3 Nano oder das neuere Nemotron 3.5 Lightning für effiziente, kostengünstige Agenten und RAG – beide self-hostbar auf moderater bis Single-GPU-Hardware; Lightning eignet sich laut NVIDIA besonders für lang laufende Agenten-Workloads
- Nemotron 3 Super als ausgewogene Wahl für anspruchsvolle Multi-Agent-Systeme
- Nemotron 3 Ultra für Frontier-Reasoning bei maximalen Anforderungen (entsprechende GPU-Infrastruktur vorausgesetzt, Bezug über Self-Hosting oder Amazon SageMaker JumpStart)
Gern beraten wir Sie zur Modellauswahl, zum Self-Hosting in der EU und zur Integration in bestehende Workflows.
