↓ Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM NVIDIA USA

NVIDIA Nemotron

NVIDIA Nemotron 3 (Nano, Super, Ultra), Nemotron 3.5 Lightning und Nemotron-3-Diarization: offene Modelle für agentische KI, Self-Hosting in der EU, DSGVO-Einordnung.

Lizenz NVIDIA Open Model License (Nemotron 3 Nano/Super laut HuggingFace-Modellkarten, permissiv, kommerzielle Nutzung erlaubt); Nemotron 3 Ultra und Nemotron 3.5 Lightning laufen laut ihren Modellkarten unter OpenMDW-1.1 (ebenfalls permissiv, kommerzielle Nutzung erlaubt)
DSGVO-Hosting Verfügbar
Kontext 128K-1M Tokens
Modalität Text, Code, Audio (Nemotron-3-Diarization) → Text, Code

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Nemotron 3.5 Lightning (30B-A3B) Empfohlen
11. August 2026
30 Mrd. Parameter gesamt, ca. 3 Mrd. aktiv (Hybrid Mamba-2 + MoE + Attention) 1M Token Kontextfenster Laut NVIDIA bis zu 4x höhere Ausgabegeschwindigkeit und rund 30 % schnellere Aufgabenerledigung für Agenten gegenüber vergleichbar großen Modellen Single-GPU-Deployment (z. B. 1x DGX Spark/GB10 oder 1x H100), läuft auch auf RTX-5090-Workstations Open Weights, Trainingsdaten und Rezepte unter OpenMDW-1.1 (BF16- und NVFP4-Checkpoints); kommerzielle Nutzung erlaubt Laut NVIDIA-Modellkarte: MMLU Pro 81,9, GPQA Diamond (ohne Tools) 75,4 (NVFP4-Checkpoint)
Erst seit 11. August 2026 verfügbar – im Vergleich zu Nemotron 3 Nano/Super/Ultra noch wenig Praxiserfahrung in der Breite Lizenz OpenMDW-1.1 statt NVIDIA Open Model License – bei Compliance-Prüfungen separat berücksichtigen
Aktuell
Nemotron-3-Diarization (100M, Sprecher-Diarisierung)
23. September 2026
Erkennt, wer wann spricht: bis zu acht Sprecher, Streaming und Offline, Latenz konfigurierbar von 80 ms bis 30,4 s 100 Mio. Parameter (31-Schichten-Transformer), 16-kHz-Mono-Audio als Eingabe, Sprecheraktivität je 10-ms-Frame als Ausgabe Laut NVIDIA-Modellkarte DER 12,73 % auf DIHARD III (Vorgängermodell 19,09 %), trainiert auf rund 10.000 Stunden realer Gespräche und 82.611 Stunden synthetischer Mischungen Ergänzt Transkriptionsmodelle wie Whisper oder gpt-transcribe um die Sprecherzuordnung in Meetings und Call-Centern
Maximal acht Sprecher, keine Sprecheridentifikation (nur Reihenfolge des Auftretens) Trainingssprachen laut Modellkarte Englisch, Mandarin, Hindi und weitere – Deutsch nicht explizit genannt, vor dem Einsatz evaluieren
Aktuell
Nemotron 3 Ultra (550B-A55B)
4. Juni 2026
550B Parameter gesamt, ca. 55B aktiv (Hybrid LatentMoE: Mamba-2 + MoE + Attention) Bis zu 1M Token Kontextfenster Frontier-Reasoning über Code, Mathematik und Wissenschaft Open Weights auf Hugging Face Über NVIDIA NIM auf build.nvidia.com verfügbar
Sehr hoher Hardware-Bedarf für Self-Hosting (z. B. 8x B200/GB200, 16x H100 oder 8x H200)
Aktuell
Nemotron 3 Super (120B-A12B) Empfohlen
März 2026 (GTC)
120B Parameter gesamt, ca. 12B aktiv (Hybrid Mamba-Transformer MoE) Starke agentische, Reasoning- und Tool-Calling-Fähigkeiten Optimiert für Multi-Agent-Systeme und hohe Durchsatzlasten Open Weights auf Hugging Face
Mittlerer bis hoher Ressourcenbedarf für Self-Hosting
Aktuell
Nemotron 3 Nano (30B-A3B) Empfohlen
15. Dezember 2025
ca. 31,6B Parameter gesamt, ca. 3,6B aktiv (Hybrid Mamba-Transformer MoE) 1M Token Kontextfenster Sehr effizient – bis zu 4x höherer Durchsatz als Nemotron Nano 2 Auf Consumer-Hardware self-hostbar (vLLM, SGLang, LM Studio, llama.cpp, Ollama) Open Weights auf Hugging Face
Kleinste Variante – für sehr komplexe Reasoning-Aufgaben weniger geeignet
Aktuell
Nemotron 3 Nano Omni (30B-A3B)
28. April 2026
Multimodal: Vereint Vision, Audio und Sprache 256K Token Kontextfenster Optimiert für effiziente, multimodale KI-Agenten
Neueres Modell – Ökosystem-Support noch im Aufbau
Aktuell
Llama Nemotron Ultra (253B)
2025
Auf Llama 3.1 basierende Reasoning-Variante 128K Token Kontext Open Weights, etabliertes Llama-Ökosystem
Vorgängergeneration – durch Nemotron 3 abgelöst
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Agentic Workflows & Multi-Agent-Systeme
Reasoning über Code, Mathematik & Wissenschaft
Tool Calling & Funktionsaufrufe
RAG & Wissensabruf
Self-Hosted Deployments auf EU-Infrastruktur
Kosteneffiziente Inferenz (Nano)

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public
Features & Capabilities
Tool Use Function Calling Structured Output Reasoning Mode
Training & Wissen
Wissensstand Mai 2026 (Ultra), Februar 2026 (Super)
Fine-Tuning Verfügbar (LoRA, Full, PEFT)
Sprachunterstützung
Beste Qualität Englisch
Unterstützt Mehrsprachig (u. a. Deutsch, Spanisch, Französisch, Italienisch, Japanisch)
Deutsch wird unterstützt; beste Qualität in Englisch. Ultra unterstützt 10 Sprachen über Englisch hinaus.

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene Infrastruktur (EU)
Open Weights - volle Kontrolle, sauberster Souveränitätspfad
AWS
Irland (eu-west-1), Mailand (eu-south-1); Frankfurt/Stockholm je nach Modell
Amazon Bedrock: Nemotron Nano 3 30B und Nemotron 3 Super 120B sind laut AWS In-Region in Irland (eu-west-1), Mailand (eu-south-1) und London (eu-west-2, UK) verfügbar. Bei Frankfurt (eu-central-1) und Stockholm (eu-north-1) widersprechen sich die AWS-Quellen: Die Modellkarten nennen beide Regionen für Nano 3 30B, die Regionsübersicht dagegen für Super 120B – vor einem Deployment in der Bedrock-Konsole prüfen. Nemotron 3 Ultra ist nicht auf Bedrock, sondern über Amazon SageMaker JumpStart (Self-Managed-Endpunkt, Region frei wählbar) verfügbar.
Azure
West Europe
Microsoft Foundry als NIM-Microservice auf Managed Compute – die Region mit passender GPU-Kapazität (z. B. West Europe) wählt der Kunde selbst, kein Serverless-/Global-Standard-Modell wie bei den MAI-Modellen. Nemotron 3 Super seit März 2026, Nemotron Nano seit Ende 2025 gelistet.
Google Cloud
Region wählbar per Self-Deployment (z. B. europe-west3 Frankfurt)
Gemini Enterprise Agent Platform (vormals Vertex AI, Rebrand April 2026) - Model Garden als selbst bereitgestelltes Modell; eine verwaltete Nemotron-API (Model as a Service) führt Googles Doku nicht auf
Lizenz & Hosting
Lizenz NVIDIA Open Model License (Nemotron 3 Nano/Super laut HuggingFace-Modellkarten, permissiv, kommerzielle Nutzung erlaubt); Nemotron 3 Ultra und Nemotron 3.5 Lightning laufen laut ihren Modellkarten unter OpenMDW-1.1 (ebenfalls permissiv, kommerzielle Nutzung erlaubt)
Sicherheitsfilter Anpassbar (Nemotron Safety / Guard Modelle verfügbar)
Enterprise Support Ja
SLA verfügbar Ja
On-Premise Edge-fähig

Benchmarks

Leistungsvergleich mit standardisierten Tests

AIME (Ultra, ohne Tools)
88,6
GPQA (Ultra)
87,0
SWE-Bench Verified (Ultra)
70,7
LiveCodeBench v6 (Ultra)
89,0
MMLU-Pro (Ultra)
86,8

NVIDIA hat seine offene Modellfamilie Nemotron 3 mit den drei Reasoning-Größen Nano, Super und Ultra komplettiert und am 11. August 2026 mit Nemotron 3.5 Lightning um ein neues, auf lang laufende Agenten spezialisiertes Modell in der Nano-Größenklasse ergänzt. Mit dem Release von Nemotron 3 Ultra (550B) am 4. Juni 2026 steht zudem erstmals ein Frontier-Modell von NVIDIA mit offenen Gewichten zur Verfügung. Die meisten Modelle stehen unter der NVIDIA Open Model License, Nemotron 3 Ultra und Nemotron 3.5 Lightning laut ihren Modellkarten unter der OpenMDW-1.1-Lizenz – beide erlauben freies Herunterladen, Anpassen und kommerziellen Betrieb. innFactory AI Consulting aus Rosenheim berät zum DSGVO-konformen Einsatz. Stand dieser Übersicht: Oktober 2026.

Was ist NVIDIA Nemotron?

Nemotron ist NVIDIAs Familie offener Modelle (Open Weights), die speziell für agentische KI und Reasoning entwickelt wurde. Anders als rein proprietäre Modelle veröffentlicht NVIDIA Gewichte, Trainingsdaten und Trainingstechniken offen – so kann die Community die Modelle selbst betreiben, anpassen und für eigene Zwecke weitertrainieren. Die aktuelle Nemotron-3-Generation nutzt eine effiziente Hybrid Mamba-Transformer Mixture-of-Experts (MoE)-Architektur, bei der pro Anfrage nur ein Bruchteil der Parameter aktiv ist.

Aktuelle Modelle im Überblick

NVIDIA bietet drei Reasoning-Größen, die sich nach Aufgabenkomplexität und Hardware skalieren:

ModellParameter (aktiv)KontextReleaseLizenz
Nemotron 3 Nanoca. 31,6B (3,6B)1M15. Dezember 2025NVIDIA Open Model License
Nemotron 3 Super120B (12B)–März 2026 (GTC)NVIDIA Open Model License
Nemotron 3 Ultra550B (55B)bis 1M4. Juni 2026OpenMDW-1.1
Nemotron 3.5 Lightning30B (3B)1M11. August 2026OpenMDW-1.1
Nemotron-3-Diarization100M–23. September 2026OpenMDW-1.1

Nemotron 3 Nano (30B-A3B)

  • ca. 31,6B Parameter gesamt, ca. 3,6B aktiv (Hybrid Mamba-Transformer MoE)
  • 1M Token Kontextfenster
  • Sehr effizient: bis zu 4x höherer Durchsatz als Nemotron Nano 2
  • Self-hostbar auf moderater Hardware (vLLM, SGLang, LM Studio, llama.cpp, Ollama)
  • Release: 15. Dezember 2025

Nemotron 3 Super (120B-A12B)

  • 120B Parameter gesamt, ca. 12B aktiv (Hybrid Mamba-Transformer MoE)
  • Starke agentische, Reasoning- und Tool-Calling-Fähigkeiten
  • Optimiert für Multi-Agent-Systeme und hohe Durchsatzlasten (z. B. IT-Ticket-Automatisierung)
  • Release: GTC, März 2026

Nemotron 3 Ultra (550B-A55B)

  • 550B Parameter gesamt, ca. 55B aktiv (Hybrid LatentMoE: Mamba-2 + MoE + Attention, mit Multi-Token Prediction)
  • Bis zu 1M Token Kontext für Langkontext-Analyse
  • Frontier-Reasoning über Code, Mathematik und Wissenschaft
  • Release: 4. Juni 2026 (Computex)

Nemotron 3.5 Lightning

Am 11. August 2026 hat NVIDIA mit Nemotron 3.5 Lightning ein Modell in der Größenklasse von Nemotron 3 Nano veröffentlicht:

  • 30 Mrd. Parameter gesamt, ca. 3 Mrd. aktiv (Hybrid-Architektur aus Mamba-2, MoE und Attention-Layern)
  • 1M Token Kontextfenster
  • Laut NVIDIA bis zu 4x höhere Ausgabegeschwindigkeit und rund 30 % schnellere Aufgabenerledigung für Agenten
  • Single-GPU-Deployment (1x DGX Spark/GB10 oder 1x H100), läuft auch auf einer RTX-5090-Workstation
  • Open Weights, Trainingsdaten und Rezepte unter der OpenMDW-1.1-Lizenz (BF16- und NVFP4-Checkpoints), nicht unter der NVIDIA Open Model License
  • Laut Modellkarte: MMLU Pro 81,9, GPQA Diamond (ohne Tools) 75,4
  • Verfügbar über Hugging Face, ModelScope, OpenRouter und build.nvidia.com (NIM-Microservice)

NVIDIA positioniert Nemotron 3.5 Lightning für lang laufende autonome Agenten und als Sub-Agenten-Workhorse in Multi-Agent-Systemen. Das Modell ergänzt die Nano-Klasse, ersetzt Nemotron 3 Nano aber nicht offiziell – beide sind laut Hersteller weiterhin aktiv gelistet.

Nemotron-3-Diarization

Nemotron-3-Diarization (23. September 2026) ist ein 100M-Parameter-Modell zur Sprecher-Diarisierung unter OpenMDW 1.1: Es erkennt, wer wann spricht (bis zu acht Sprecher, Streaming und Offline, Latenz von 80 ms bis 30,4 s). Laut NVIDIA-Modellkarte liegt die DER auf DIHARD III bei 12,73 % (Vorgängermodell: 19,09 %). Es ergänzt Transkriptionsmodelle um die Sprecherzuordnung in Meetings und Call-Centern, identifiziert aber keine Personen und läuft auf eigener Infrastruktur (NeMo, Transformers oder C++-Runtime).

Weitere Modelle: NVIDIA pflegt zusätzlich Nemotron Nano Omni (multimodal, Vision/Audio/Sprache, 256K Kontext), Nemotron 3.5 ASR (600M-Parameter-Streaming-Spracherkennung für 40 Sprach-Locales, seit 4. Juni 2026), Nemotron 3.5 Content Safety (4B-Parameter-Sicherheitsmodell für Multimodal-Moderation), Retriever-/RAG-Modelle sowie OCR-Modelle. Die ältere Llama-Nemotron-Reihe (Nano 8B, Super 49B, Ultra 253B) basiert auf Llama 3.1 mit 128K Kontext.

Besondere Stärken

Effizienz durch Hybrid-MoE

Die Mamba-Transformer-MoE-Architektur aktiviert pro Token nur einen Bruchteil der Gesamtparameter. Das senkt Inferenzkosten deutlich – Nemotron 3 Nano erreicht laut NVIDIA bis zu 4x höheren Durchsatz als die Vorgängergeneration und reduziert die Anzahl der Reasoning-Tokens.

Agentic & Tool Use

Alle Nemotron-3-Modelle sind auf agentische Workflows ausgelegt: natives Tool Calling, Funktionsaufrufe und strukturierte Ausgaben für Multi-Agent-Systeme.

Open Weights & permissive Lizenz

Die NVIDIA Open Model License ist permissiv und erlaubt Nutzung, Modifikation, Weitergabe und kommerziellen Einsatz – ohne Namensnennungspflicht. NVIDIA veröffentlicht zusätzlich Trainingsdatensätze und Tools (NeMo Gym, NeMo RL, NeMo Evaluator).

Hinweis: Bei einzelnen Modellkarten auf Hugging Face werden teils abweichende Lizenzbezeichnungen (z. B. OpenMDW) geführt. Wir prüfen die konkrete Lizenz pro Modell und Version im Rahmen der Beratung.

EU-Verfügbarkeit & DSGVO-Konformität

Weil Nemotron als Open Weights veröffentlicht wird, ist der sauberste Souveränitätspfad das Self-Hosting auf EU-Infrastruktur – alle Daten bleiben unter Ihrer Kontrolle.

Self-Hosting (empfohlen für Souveränität)

  • Betrieb auf eigener Hardware oder bei einem EU-Cloud-Anbieter (z. B. in Frankfurt)
  • Volle DSGVO-Konformität, keine Abhängigkeit von US-APIs
  • Nano lässt sich bereits auf moderater Hardware betreiben; Ultra benötigt mehrere High-End-GPUs (z. B. 8x B200/GB200, 16x H100 oder 8x H200)

Managed über Hyperscaler (EU-Regionen)

  • AWS: Amazon Bedrock bietet Nemotron Nano 3 30B und Nemotron 3 Super 120B laut AWS In-Region in Irland (eu-west-1), Mailand (eu-south-1) und London (eu-west-2, UK). Bei Frankfurt (eu-central-1) und Stockholm (eu-north-1) widersprechen sich die AWS-Quellen: Die Modellkarten nennen beide Regionen für Nano 3 30B, die Regionsübersicht dagegen für Super 120B – vor einem Deployment daher in der Bedrock-Konsole prüfen. Nemotron 3 Ultra ist nicht auf Bedrock gelistet, sondern über Amazon SageMaker JumpStart verfügbar (Self-Managed-Endpunkt, Region frei wählbar, z. B. Frankfurt)
  • Microsoft Foundry: Nemotron 3 Nano und Super laufen als NIM-Microservice auf Managed Compute – die Azure-Region mit passender GPU-Kapazität (z. B. West Europe) wählt der Kunde selbst; anders als bei den MAI-Modellen handelt es sich nicht um ein Serverless-/Global-Standard-Angebot
  • Google: Gemini Enterprise Agent Platform (vormals Vertex AI – Rebrand im April 2026 auf der Cloud Next) im Model Garden – konkrete EU-Regionen für Nemotron dort nicht abschließend verifiziert

Direkt über NVIDIA

  • build.nvidia.com und NVIDIA NIM Microservices für gehostete Endpunkte bzw. containerisierte Self-Service-Deployments
  • Hosted-Inferenz auch über Anbieter wie Together AI, Fireworks, DeepInfra, OpenRouter, Baseten

Für sensible Daten empfehlen wir Self-Hosting in der EU. Für schnellen Start eignen sich EU-Regionen der Hyperscaler oder NIM-Container in eigener Cloud-Umgebung.

Integration mit CompanyGPT

Dank Open Weights lässt sich Nemotron gut in unsere DSGVO-konforme Lösung CompanyGPT integrieren. So können Sie ein leistungsstarkes Reasoning- und Agenten-Modell vollständig in Ihrer eigenen oder einer EU-gehosteten Umgebung betreiben – ohne dass Unternehmensdaten in Drittländer abfließen. innFactory AI Consulting übernimmt Auswahl, Deployment und Feintuning des passenden Nemotron-Modells.

Unsere Empfehlung

Nemotron ist eine offene Modellfamilie für agentische und Reasoning-Anwendungen – und durch die Open Weights gut geeignet für souveräne, DSGVO-konforme Deployments.

Für die meisten Unternehmen empfehlen wir:

  • Nemotron 3 Nano oder das neuere Nemotron 3.5 Lightning für effiziente, kostengünstige Agenten und RAG – beide self-hostbar auf moderater bis Single-GPU-Hardware; Lightning eignet sich laut NVIDIA besonders für lang laufende Agenten-Workloads
  • Nemotron 3 Super als ausgewogene Wahl für anspruchsvolle Multi-Agent-Systeme
  • Nemotron 3 Ultra für Frontier-Reasoning bei maximalen Anforderungen (entsprechende GPU-Infrastruktur vorausgesetzt, Bezug über Self-Hosting oder Amazon SageMaker JumpStart)

Gern beraten wir Sie zur Modellauswahl, zum Self-Hosting in der EU und zur Integration in bestehende Workflows.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.