↓ Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM Tencent China

Tencent Hunyuan (Hy3)

Tencent Hunyuan Hy3 und Hy4-Preview: Open-Source-MoE-Modelle unter Apache 2.0 ohne EU-Einschränkung. Benchmarks, API-Preise und DSGVO-konformes Self-Hosting.

Lizenz Apache 2.0 (Hy3 seit 6. Juli 2026, Hy4-Preview seit 28. August 2026; Hy3-Preview-Lizenz vom April 2026 schloss EU aus)
DSGVO-Hosting Verfügbar
Kontext 256000 Tokens
Modalität Text, Code → Text, Code

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Hy4-Preview
28. August 2026
MoE-Architektur: 770B Gesamt-, 49B aktive Parameter Kontextfenster über 1 Mio. Token laut Tencent Apache-2.0-Lizenz auch für die Preview-Version – anders als bei der Hy3-Preview vom April 2026 In Tencents interner Blind-Evaluation (163 Experten, 203 Engineering-Aufgaben) mit 2,99 von 4,00 knapp vor GLM-5.3 (2,92) und Kimi K3 (2,94) bewertet Zusätzliche FP8-quantisierte Variante (tencent/Hy4-preview-FP8) für effizienteres Self-Hosting Bereits am Starttag in WorkBuddy, CodeBuddy, Yuanbao und ima integriert
Noch Preview-Status – laut Tencent kein finales Release, Verhalten kann sich noch ändern Die interne Vergleichsevaluation stammt von Tencent selbst, keine unabhängige Drittbestätigung bekannt API läuft über Tencent Cloud (China) – für EU-Unternehmen nur Self-Hosting empfehlenswert
Aktuell
Hy3 Empfohlen
6. Juli 2026
MoE-Architektur: 295B Gesamt-, nur 21B aktive Parameter (192 Experten, Top-8) 256K Token Kontext Hybrides Fast-/Slow-Thinking (umschaltbares Reasoning) Multi-Token-Prediction-Layer für schnelleres Decoding Apache 2.0 – permissivste Lizenz unter den großen China-Modellen Starke Benchmarks: GPQA Diamond 90,4, SWE-bench Verified 78 % Günstige API (ca. $0,18 Input / $0,59 Output pro 1M Tokens via Tencent Cloud)
Coding hinter GLM-5.2, Claude Opus 4.8 und GPT-5.5 Multimodalität (Vision) und Wissensstand nicht dokumentiert API läuft über Tencent Cloud (China) – für EU-Unternehmen nur Self-Hosting empfehlenswert
Aktuell
Hy3-FP8
6. Juli 2026
FP8-quantisierte Variante für effizientes Self-Hosting Reduzierter Speicherbedarf bei nahezu gleicher Qualität
Quantisierung kann in Randfällen Qualität kosten
Aktuell
Hy3-Preview
23. April 2026
Technischer Vorläufer der Vollversion
Lizenz mit Territorialbeschränkung (keine EU-Nutzung) Abgelöst durch die Apache-2.0-Vollversion
Veraltet

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Self-Hosting in der eigenen Cloud
Kosteneffiziente Reasoning-Workloads
Agentic Workflows
Recherche und Analyse (BrowseComp-stark)
Open-Source-Forschung

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public (Tencent Cloud TokenHub, OpenRouter); Weights auf Hugging Face und ModelScope
Features & Capabilities
Tool Use Function Calling Structured Output Reasoning Mode
Training & Wissen
Wissensstand nicht dokumentiert
Fine-Tuning Verfügbar (LoRA, Full)
Sprachunterstützung
Beste Qualität Chinesisch, Englisch
Unterstützt mehrsprachig
Beste Qualität in Chinesisch und Englisch

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene Infrastruktur / eigene Cloud (z. B. STACKIT, Azure, AWS)
Open Weights unter Apache 2.0 – volle Datensouveränität beim Eigenbetrieb
Lizenz & Hosting
Lizenz Apache 2.0 (Hy3 seit 6. Juli 2026, Hy4-Preview seit 28. August 2026; Hy3-Preview-Lizenz vom April 2026 schloss EU aus)
Sicherheitsfilter Anpassbar (Open Weights)
On-Premise

Benchmarks

Leistungsvergleich mit standardisierten Tests

Interne Blind-Evaluation, 203 Engineering-Aufgaben (Hy4-Preview)
2.99
Interne Blind-Evaluation, 203 Engineering-Aufgaben (GLM-5.3, zum Vergleich)
2.92
Interne Blind-Evaluation, 203 Engineering-Aufgaben (Kimi K3, zum Vergleich)
2.94
GPQA Diamond
90.4
SWE-bench Verified
78
SWE-bench Pro
57.9
BrowseComp
84.2

Tencent Hy3 ist die dritte Generation der Hunyuan-Modellfamilie und seit dem 6. Juli 2026 als Vollversion verfügbar – erstmals unter einer echten Apache-2.0-Lizenz ohne Territorialbeschränkung. Das ist die eigentliche Nachricht für europäische Unternehmen: Die Lizenz der April-Preview schloss die Nutzung in der EU, in UK und in Südkorea noch explizit aus; mit dem finalen Release ist diese Einschränkung aufgehoben. Mit Hy4-Preview (28. August 2026) liegt zusätzlich eine deutlich größere Open-Weights-Vorschau (770 statt 295 Mrd. Gesamtparameter) ebenfalls unter Apache 2.0 vor; Hy3 bleibt die stabile Referenz für produktives Self-Hosting. Stand dieser Übersicht: Oktober 2026.

Architektur: Effizienz statt Größe

Hy3 ist ein Mixture-of-Experts-Modell mit 295 Milliarden Gesamt- und nur 21 Milliarden aktiven Parametern (192 Experten, davon 8 aktiv pro Token). Dazu kommen ein 256K-Token-Kontextfenster, ein zusätzlicher Multi-Token-Prediction-Layer für schnelleres Decoding und ein hybrides Fast-/Slow-Thinking-Konzept, das zwischen schneller Antwort und tiefem Reasoning umschaltet. Neben der Standardversion gibt es eine FP8-quantisierte Variante für effizientes Self-Hosting.

Die Positionierung ist klar: Hy3 ist das Effizienz-Play unter den chinesischen Open-Source-Modellen – deutlich kleiner als DeepSeek V4-Pro (1,6 Billionen Parameter) und GLM-5.2 (744 Milliarden), bei konkurrenzfähigen Ergebnissen in den meisten Disziplinen außer Coding.

Benchmarks

Laut Tencent und unabhängigen Auswertungen erreicht Hy3 unter anderem 90,4 auf GPQA Diamond, 78 % auf SWE-bench Verified, 57,9 % auf SWE-bench Pro und 84,2 auf BrowseComp. Bei anspruchsvoller Mathematik (MathArena Apex: 38,7 vs. 85,4 bei GPT-5.5) und beim Coding liegt das Modell hinter den westlichen Flaggschiffen und hinter GLM-5.2. Für die Modellgröße – nur 21B aktive Parameter – sind die Werte bemerkenswert.

Hy4-Preview: die nächste Generation

Mit Hy4-Preview hat Tencent am 28. August 2026 den Nachfolger als Open-Weights-Vorschau veröffentlicht (Hugging Face: tencent/Hy4-preview, zusätzlich als FP8-Variante tencent/Hy4-preview-FP8). Beide stehen laut Hugging-Face-Modellkarte unter Apache 2.0 – anders als bei Hy3 gibt es hier von Anfang an keine Territorialbeschränkung.

Eckdaten (Herstellerangaben):

  • 770 Mrd. Gesamt-, 49 Mrd. aktive Parameter (MoE) – deutlich größer als Hy3
  • Kontextfenster über 1 Mio. Token
  • In einer internen Blind-Evaluation von Tencent (163 Experten, 203 Engineering-Aufgaben) erreicht Hy4-Preview 2,99 von 4,00 Punkten, knapp vor GLM-5.3 (2,92) und Kimi K3 (2,94)
  • Integration in Tencents eigene Produkte WorkBuddy, CodeBuddy, Yuanbao und ima bereits zum Start
  • API über Tencent Cloud TokenHub: laut Anbieter rund 0,834 USD/1M Input, 2,50 USD/1M Output, 0,042 USD/1M Cache-Hit

Einordnung: Es handelt sich ausdrücklich um eine Preview, keine finale Vollversion – Die Vergleichswerte gegenüber GLM-5.3 und Kimi K3 stammen aus einer internen Tencent-Evaluation; eine unabhängige Drittbestätigung liegt uns nicht vor. Für produktive Self-Hosting-Einsätze empfehlen wir daher weiterhin Hy3 als etablierte, stabile Vollversion und beobachten die Weiterentwicklung von Hy4.

Verfügbarkeit und Kosten

Die Weights stehen auf Hugging Face und ModelScope bereit; als API ist Hy3 über Tencent Clouds TokenHub (ca. $0,18 Input / $0,59 Output pro 1M Tokens) und über OpenRouter verfügbar. In Tencents eigenem Ökosystem treibt Hy3 unter anderem den WeChat-Assistenten, Yuanbao und CodeBuddy an.

DSGVO und Datensouveränität: Self-Hosting ja, China-API mit Vorsicht

Für europäische Unternehmen gilt dieselbe Logik wie bei DeepSeek und Qwen: Interessant ist Hy3 vor allem als Open-Weights-Modell für den Eigenbetrieb. Unter Apache 2.0 lässt es sich in der eigenen Cloud-Umgebung hosten – etwa auf STACKIT, Azure oder AWS –, womit keine Daten an den Anbieter fließen und volle Datensouveränität besteht. Die API über Tencent Cloud bedeutet dagegen Datenverarbeitung durch einen chinesischen Anbieter und ist für personenbezogene oder vertrauliche Daten aus DSGVO-Sicht kritisch zu bewerten.

Wer die Lizenz prüft, sollte außerdem auf die Version achten: Nur die Vollversion vom 6. Juli 2026 sowie Hy4-Preview vom 28. August 2026 stehen unter Apache 2.0 – wer noch Artefakte der April-2026-Preview von Hy3 einsetzt, arbeitet unter der alten Community-Lizenz mit EU-Ausschluss.

Hyperscaler-Kataloge: Für Hunyuan haben wir kein natives Angebot auf AWS Bedrock (kein Modell-Eintrag in den Bedrock-Modellkarten), Google Vertex AI (die entsprechende Model-Garden-Dokumentationsseite liefert einen 404-Fehler) oder Azure AI Foundry gefunden. Anders als bei GLM, Kimi oder MiniMax ist Hunyuan damit weder direkt noch über Fireworks-Partnerschaften in den großen Hyperscaler-Katalogen sichtbar; Self-Hosting bleibt der einzige uns bekannte Weg zu EU-Datenverarbeitung.

Einordnung im China-Vergleich

ModellGröße (aktiv)LizenzBesonderheit
Tencent Hy4-Preview770B (49B)Apache 2.0Neuestes Modell, noch Preview-Status
Tencent Hy3295B (21B)Apache 2.0Effizienz, permissivste Lizenz
DeepSeek V41,6T (Pro)MITReasoning-Spitze der Open Models
GLM-5.2744BMITCoding-Stärke
Qwen 3.7API-only (Max)proprietär (Max)Alibaba-Ökosystem

Integration mit CompanyGPT

Als Open-Weights-Modell lässt sich Hy3 – wie Llama, Qwen oder GptOSS – in eine selbst gehostete Plattform wie CompanyGPT integrieren und DSGVO-konform in der eigenen Cloud betreiben. Für die meisten Enterprise-Anwendungsfälle im DACH-Raum empfehlen wir weiterhin die etablierten Frontier-Modelle über EU-Endpunkte; Hy3 ist eine spannende Option für kosteneffiziente, souverän gehostete Workloads.

Für eine individuelle Beratung zur passenden Modellstrategie kontaktieren Sie innFactory AI Consulting.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.