Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM Alibaba China

Alibaba Qwen

Alibaba Qwen 3.8 - Qwen3.8-Flash-Next als Open-Weight-Vorschau auf die Qwen4-Architektur (125B/6B aktiv, Qwen-Community-Lizenz), Qwen3.8-27B als Apache-2.0-Favorit für Self-Hosting und Qwen3.8-Max mit 2,4 Bio. Parametern. Alles zu Lizenzen, Benchmarks und DSGVO. Stand: 3. September 2026. KI-Beratung Rosenheim für souveränes Self-Hosting.

Lizenz Apache 2.0 (Qwen3.8-27B); qwen-community-1.0 (Qwen3.8-Flash-Next); eigene Qwen3.8-Max-Lizenz für die offenen Gewichte des Flaggschiffs
DSGVO-Hosting Verfügbar
Kontext 262k nativ (Qwen3.8-27B, Qwen3.8-Flash-Next), bis 1M (Qwen3.8-Max, Qwen3.8-Flash) Tokens
Modalität Text, Image, Video → Text, Image

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Qwen3.8-Flash-Next (Open Weights)
26. August 2026
125 Mrd. Parameter mit nur 6 Mrd. aktiv pro Token, dazu 51 Mrd. Parameter N-Gram-Embedding und 4 Mrd. MTP (laut Model Card) Von Qwen als experimentelle Vorschau auf die Architektur bezeichnet, die Qwen4 zugrunde liegen soll 262.144 Token nativer Kontext, per YaRN auf bis zu 1M erweiterbar Multimodal: Text-, Bild- und Videoeingabe Herstellerangaben: SWE-bench Pro 62,5 · LiveCodeBench v6 91,9 · CoWorkBench 73,9 · GPQA Diamond 91,7 Unabhängig gemessen: 56 Punkte im Artificial Analysis Intelligence Index v4.1.1 bei rund 86 Token/s Separater FP8-Checkpoint (Qwen3.8-Flash-Next-FP8) verfügbar
Nicht Apache 2.0: Lizenz qwen-community-1.0 laut Model Card – auch wenn Presseberichte teils Apache 2.0 nennen Experimentelle Architektur-Vorschau, kein GA-Modell Hoher Token-Verbrauch: rund 200 Mio. Output-Token im Artificial-Analysis-Index Gesamtgewichte (rund 180 Mrd. Parameter inkl. Embedding) benötigen trotz 6B aktiv deutlich mehr Speicher als Qwen3.8-27B
Aktuell
Qwen3.8-Flash (API)
26. August 2026
1M Token Kontextfenster als Standard und bis 131k Token Ausgabe (nach Sekundärquellen) Built-in Tools laut Ankündigung; OpenAI- und Anthropic-kompatible Endpunkte Gleiche Architektur wie Qwen3.8-Flash-Next (125B / 6B aktiv + 51B N-Gram-Embedding)
Proprietäre Produktionsvariante – die offenen Gewichte heißen Qwen3.8-Flash-Next Preise und Limits von Alibaba nicht öffentlich verifizierbar, nur über Drittanbieter
Aktuell
Qwen3.8-27B Empfohlen
14. August 2026
Dense-Modell mit rund 27,8 Mrd. Parametern – läuft auf einer 24-GB-GPU Apache 2.0 – uneingeschränktes Self-Hosting und kommerzielle Nutzung 262.144 Token nativer Kontext, per YaRN auf bis zu 1M erweiterbar Bild- und Videoverständnis, Thinking-Modus per reasoning_effort steuerbar 52 Punkte im Artificial Analysis Intelligence Index (unabhängig, xhigh) – laut Artificial Analysis Rang 1 unter den dort gelisteten Open-Weight-Modellen
Neigt laut unabhängigen Praxistests zu sehr langen Reasoning-Ketten Hoher Token-Verbrauch: 160 Mio. Output-Token im Artificial-Analysis-Index gegenüber rund 45 Mio. im Median vergleichbarer Modelle Niedrige Ausgabegeschwindigkeit (laut Artificial Analysis rund 54 Token/s)
Aktuell
Qwen3.8-Max (API)
3. August 2026
MoE mit 2,4 Bio. Parametern total, davon 95 Mrd. aktiv 1M Token Kontextfenster, bis 131.072 Token Ausgabe Text-, Bild- und Videoeingabe, Function Calling und Structured Output 58 Punkte im Artificial Analysis Intelligence Index (Rang 10 von 188)
API-Variante proprietär Geringe Ausgabegeschwindigkeit (rund 45 Token/s laut Artificial Analysis) Kein Batch-Inference, kein Fine-Tuning
Aktuell
Qwen3.8-2.4T-A95B (Open Weights)
August 2026
Erstes Max-Modell von Qwen mit offenen Gewichten 262.144 Token nativer Kontext, erweiterbar auf rund 1M Auf Hugging Face und ModelScope verfügbar
Nur Text – keine Bild-/Videoeingabe wie bei der API-Variante Thinking-Modus lässt sich nicht abschalten Eigene Lizenz statt Apache 2.0: gesonderte kommerzielle Lizenz für MaaS-/KI-Assistenz-Anbieter ab 50 Mio. US-Dollar Umsatz Sehr hoher Hardwarebedarf
Aktuell
Qwen3.7-Plus
1. Juni 2026
Multimodaler Agent (Text, Bild, Video) 1M Token Kontextfenster Deep Reasoning, Tool Invocation, autonome Iteration Sehr günstig pro Token
Proprietär, keine Open Weights API-only via Alibaba Cloud Bailian / Model Studio
Aktuell
Qwen3.7-Max
20. Mai 2026
Neues Qwen-Flaggschiff, präsentiert auf dem Apsara Summit Hangzhou 1M Token Kontextfenster Spitzenwerte auf Terminal-Bench 2.0, SWE-Bench Pro und MCP-Atlas (laut Alibaba) Unterstützt das Anthropic-Protokoll (MCP)
Proprietär, keine Open Weights API-only via Alibaba Cloud Model Studio
Aktuell
Qwen3.6-Max-Preview
20. April 2026
Stärkstes Qwen-Modell (proprietär, geschlossene Gewichte) Spitze in sechs agentic Coding-Benchmarks (laut Alibaba) Multimodal (Text + Bild)
Preview-Build, durch die GA-Modelle der Reihen 3.7 und 3.8 abgelöst Erstmals in Qwens Historie keine Open Weights – nur über Alibaba Cloud Model Studio
Veraltet
Qwen3.6-Plus
2026-04
Fokus auf Real-World-Agenten Multimodal
Proprietär, nicht Open Source
Aktuell
Qwen3.6-27B
2026-04
28B Dense-Modell Open Weights Multimodal (Text + Bild)
Hoher Ressourcenbedarf für 27B-Klasse
Aktuell
Qwen3.6-35B-A3B
2026-04
MoE: 36B total, nur 3B aktiv – extrem effizient Apache 2.0 Lizenz Multimodal Übertrifft Google Gemma 4 in Benchmarks
Als Open-Weight-Empfehlung durch Qwen3.8-27B abgelöst
Aktuell
Qwen3.5-397B-A17B
16. Februar 2026
Flaggschiff (MoE, 17B aktiv) Native Multimodalität (Text, Bild, Video) Bis 1M Kontext Agentic AI Workflows #5 weltweit in Mathe-Reasoning (LM Arena)
Hoher Ressourcenbedarf
Aktuell
Qwen3.5-Max-Preview
2026-03
Führendes chinesisches Modell auf LM Arena #5 global im Mathe-Reasoning
Preview-Build, durch neuere GA-Modelle abgelöst
Veraltet
Qwen3.5-9B
2026-03
Starkes logisches Reasoning Rivalisiert 30B+ Modelle Nativ multimodal Ideal für Edge-Server
Begrenzt bei sehr komplexen Aufgaben
Aktuell
Qwen3.5-4B
2026-03
Nativer multimodaler Agent UI-Navigation und Dokumentenanalyse Kompakt und effizient
Begrenzte Kapazität
Aktuell
Qwen3.5-2B
2026-03
Für Mobile und Edge optimiert Nativ multimodal
Begrenzte Kapazität
Aktuell
Qwen3.5-0.8B
2026-03
Ultra-kompakt für IoT und Smartphones Nativ multimodal
Stark begrenzte Kapazität
Aktuell
Qwen3-235B-A22B
2025
Starkes Vorgängermodell (MoE, 22B aktiv) Open Weights Bis 1M Kontext (Konfiguration)
Hoher Ressourcenbedarf
Aktuell
Qwen3-32B
2025
Allround-Modell Open Weights
Aktuell
Qwen3-Coder
August 2025
Spezialisiert auf Software-Engineering Open Weights, Apache 2.0
Coding-Spezialmodell
Aktuell
QwQ-32B
März 2025
Reasoning-Spezialmodell (Chain-of-Thought) 32B Parameter, Open Weights
Höhere Latenz durch Reasoning-Modus
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Mehrsprachige Kommunikation
Video-Analyse und Zusammenfassung
Bildgenerierung mit Text
Self-Hosted AI
Agentic Workflows & Automation
Internationale Teams (Asien-Europa)
Content-Erstellung
Safety & Moderation
Übersetzung

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public
Latenz (TTFT) Variiert (Self-Hosted)
Features & Capabilities
Tool Use Function Calling Structured Output Vision Reasoning Mode Datei-Upload
Training & Wissen
Wissensstand 2025-12
Fine-Tuning Verfügbar (LoRA, Full, PEFT)
Sprachunterstützung
Beste Qualität Chinesisch, Englisch, Deutsch
Unterstützt 200+ Sprachen und Dialekte (Qwen3.5)
Herausragend in Chinesisch, sehr gut in europäischen Sprachen, erweiterte Abdeckung für Südasien, Afrika und Ozeanien

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene Infrastruktur
Empfohlen für Unternehmensdaten
AWS Bedrock
Frankfurt (eu-central-1)
Qwen3-Modelle (u. a. Qwen3-32B, Qwen3-Coder-30B) – Qwen 3.8 dort bislang nicht gelistet
Alibaba Cloud Model Studio
Germany (Frankfurt)
Workspace mit Deployment-Scope „EU“ begrenzt die Inferenz auf die EU – Drittlandbezug gesondert prüfen
EU-Inferenzanbieter
Deutschland / EU
Anbieter wie IONOS AI Model Hub, STACKIT, Scaleway oder Nebius hosten offene Modelle in der EU – konkrete Qwen-3.8-Verfügbarkeit vorab prüfen
Lizenz & Hosting
Lizenz Apache 2.0 (Qwen3.8-27B); qwen-community-1.0 (Qwen3.8-Flash-Next); eigene Qwen3.8-Max-Lizenz für die offenen Gewichte des Flaggschiffs
Sicherheitsfilter Anpassbar (Qwen3Guard)
On-Premise Edge-fähig

Benchmarks

Leistungsvergleich mit standardisierten Tests

Artificial Analysis Intelligence Index
58
Artificial Analysis Intelligence Index
56
SWE-Bench Pro
62.5
LiveCodeBench v6
91.9
Artificial Analysis Intelligence Index
52
OSWorld-Verified
86.1
SWE-Bench Pro
67.7
GPQA Diamond
89.2
SWE-Bench Pro
61.7
MMLU
90.6%

Als KI-Beratung aus Rosenheim empfehlen wir Qwen-Modelle für Unternehmen, die eine Alternative mit offenen Gewichten suchen. Mit der Qwen 3.8-Generation (August 2026) liefert Alibaba drei sehr unterschiedliche Bausteine: das kompakte, unter Apache 2.0 stehende Qwen3.8-27B für lokalen Betrieb, das MoE-Flaggschiff Qwen3.8-Max mit 2,4 Billionen Parametern – und seit dem 26. August 2026 mit Qwen3.8-Flash-Next eine offene Vorschau auf die Architektur der kommenden Qwen4-Generation. Für den DSGVO-konformen Einsatz im DACH-Raum empfehlen wir Self-Hosting auf EU-Infrastruktur.

Qwen 3.8: Drei Modelle, drei Lizenzen (Stand 3. September 2026)

Die Qwen-3.8-Generation trennt deutlich zwischen einem frei nutzbaren Arbeitspferd, einem lizenzrechtlich eingehegten Flaggschiff und einer experimentellen Architektur-Vorschau mit eigener Community-Lizenz.

Qwen3.8-Flash-Next – offene Vorschau auf die Qwen4-Architektur

Am 26. August 2026 hat das Qwen-Team Qwen3.8-Flash-Next auf Hugging Face und ModelScope veröffentlicht. Das Modell ist laut Model Card eine „experimental preview of the architecture that will underpin Qwen4" – also ausdrücklich kein GA-Modell, sondern ein Blick auf die nächste Generation. Die Eckdaten laut Model Card:

  • 125 Milliarden Parameter, davon nur 6 Milliarden aktiv pro Token, ergänzt um ein N-Gram-Embedding mit 51 Milliarden Parametern und ein Multi-Token-Prediction-Modul mit 4 Milliarden Parametern
  • 262.144 Token nativer Kontext, per YaRN auf bis zu 1 Million Token erweiterbar
  • Multimodal: Text-, Bild- und Videoeingabe
  • Lizenz: qwen-community-1.0 – nicht Apache 2.0, auch wenn manche Presseberichte das schreiben. Maßgeblich ist der Lizenztext im Repository.
  • Herstellerangaben: SWE-bench Pro 62,5 · LiveCodeBench v6 91,9 · CoWorkBench 73,9 · GPQA Diamond 91,7 · MathVision 95,7 · AndroidWorld 84,5
  • Ein separater FP8-Checkpoint (Qwen3.8-Flash-Next-FP8) steht unter derselben Lizenz bereit; die Leistung ist laut Qwen nahezu identisch mit dem BF16-Original

Unabhängig gemessen erreicht Qwen3.8-Flash-Next 56 Punkte im Artificial Analysis Intelligence Index v4.1.1 bei rund 86 Token/s Ausgabegeschwindigkeit – erzeugte für den Index allerdings rund 200 Millionen Output-Token. Auch hier gilt: Token-Verbrauch am eigenen Workload messen.

Parallel dazu hat Alibaba Qwen3.8-Flash als Produktions-API über Alibaba Cloud Model Studio angekündigt (Modell-ID qwen3.8-flash). Nach Sekundärquellen bietet die API standardmäßig 1 Million Token Kontext, bis zu 131k Token Ausgabe und Built-in Tools; als Preis nennen Drittanbieter wie OpenRouter und Artificial Analysis rund 0,15 US-Dollar / 1M Input und 0,47 US-Dollar / 1M Output, regional abweichend. Eine öffentlich zugängliche Preisliste von Alibaba Cloud konnten wir zum Stand 3. September 2026 nicht verifizieren – bitte direkt im Model Studio prüfen.

Einordnung: Für Self-Hosting ist Qwen3.8-Flash-Next wegen der 6 Milliarden aktiven Parameter sehr durchsatzstark, benötigt aber Speicher für die vollen rund 180 Milliarden Parameter inklusive Embedding-Tabelle. Wer heute eine produktive, unkompliziert lizenzierte Basis braucht, bleibt bei Qwen3.8-27B (Apache 2.0). Wer die Qwen4-Architektur früh evaluieren will, hat mit Flash-Next dafür einen offenen Kandidaten. Qwen 4 selbst hat Alibaba zum Stand 3. September 2026 nicht angekündigt.

Qwen3.8-27B – unser neuer Open-Weight-Favorit

Am 14. August 2026 hat das Qwen-Team die Gewichte von Qwen3.8-27B auf Hugging Face und ModelScope veröffentlicht – ein dichtes Modell mit rund 27,8 Milliarden Parametern unter Apache 2.0:

  • 262.144 Token nativer Kontext, per YaRN-RoPE-Scaling (vLLM, SGLang) auf bis zu 1 Million Token erweiterbar
  • Native Bild- und Videoverarbeitung – von STEM-Diagrammen und Dokumenten bis zu stundenlangen Videos
  • Thinking-Modus standardmäßig aktiv, aber pro Anfrage abschaltbar; die Reasoning-Tiefe lässt sich über den Parameter reasoning_effort steuern
  • Tool-Calling über die gängigen Inferenz-Frameworks (vLLM, SGLang, Ollama, llama.cpp, LM Studio)
  • Herstellerangaben zu Benchmarks: SWE-Bench Pro 61,7 · GPQA Diamond 89,2 · OSWorld-Verified 84,3 · MathVision 94,6

Praktisch entscheidend ist die Größe: Das Modell passt als quantisierte Datei in den Speicher einer 24-GB-Karte (z. B. RTX 3090) oder eines entsprechend ausgestatteten Notebooks. Damit wird ein leistungsfähiges multimodales Modell lokal betreibbar – ohne dass Daten das Unternehmen verlassen.

Einordnung (aktualisiert am 22. August 2026): Die Benchmarkwerte zum Start stammten fast vollständig vom Hersteller. Inzwischen liegt eine unabhängige Messung vor: Artificial Analysis ordnet Qwen3.8-27B im Modus xhigh mit 52 Punkten im Intelligence Index ein und führt es damit als bestplatziertes Open-Weight-Modell seiner Liste. Der Preis dafür ist Rechenzeit: Für den Index erzeugte das Modell rund 160 Millionen Output-Token (Median vergleichbarer Modelle: etwa 45 Millionen) bei einer gemessenen Ausgabegeschwindigkeit von rund 54 Token/s. Das deckt sich mit dem wiederkehrenden Praxisbefund aus der Community: Das Modell denkt im Standardmodus deutlich länger als nötig – wer Latenz und Token-Kosten im Blick hat, sollte reasoning_effort aktiv konfigurieren.

Qwen3.8-Max – Flaggschiff mit eigener Lizenz

Qwen3.8-Max ist seit dem 3. August 2026 über Alibaba Cloud Model Studio verfügbar: ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern total und 95 Milliarden aktiven Parametern.

  • 1 Million Token Kontextfenster, max. 991.808 Token Eingabe (983.616 im Thinking-Modus), bis 131.072 Token Ausgabe, Chain-of-Thought-Budget 262.144 Token
  • Text-, Bild- und Videoeingabe, Ausgabe als Text
  • Function Calling und Structured Output werden unterstützt; Batch-Inference und Fine-Tuning nicht
  • Regionen: China (Peking), Singapur, Germany (Frankfurt), Japan (Tokio), Hongkong, USA (Virginia)
  • Listenpreise laut Alibaba: ab 1,65 US-Dollar / 1M Input und 4,951 US-Dollar / 1M Output; in der Region Singapur 2,00 bzw. 6,00 US-Dollar

Rund zehn Tage nach dem API-Start hat Alibaba auch die Gewichte unter dem Namen Qwen3.8-2.4T-A95B veröffentlicht – erstmals für ein Modell der Max-Klasse. Dabei sind zwei Einschränkungen wichtig:

  1. Die offenen Gewichte sind reines Text-Modell. Die multimodale Eingabe (Bild, Video) gibt es nur über die API-Variante. Zudem lässt sich der Thinking-Modus in der Open-Weight-Version nicht deaktivieren.
  2. Nicht Apache 2.0. Statt der bisherigen permissiven Lizenz gilt eine eigene Qwen3.8-Max-Lizenz. Berichten zufolge verlangt sie eine gesonderte kommerzielle Lizenz von Unternehmen, die das Modell in einem „Model as a Service"- oder „AI work assistant"-Geschäft einsetzen und dabei über einen zusammenhängenden Zeitraum von zwölf Monaten mehr als 50 Millionen US-Dollar Umsatz erzielen. Reine interne Nutzung ohne Zugang für Dritte soll davon ausgenommen sein.

Für die Praxis: Für die allermeisten mittelständischen Anwender im DACH-Raum ist die Umsatzschwelle nicht einschlägig. Wer Qwen3.8-2.4T-A95B allerdings als Bestandteil eines eigenen KI-Produkts weiterverkaufen will, sollte den Lizenztext vor dem Rollout juristisch prüfen lassen – Apache-2.0-Erfahrungswerte aus früheren Qwen-Generationen lassen sich hier nicht übertragen.

Unabhängige Bewertung vs. Herstellerangaben

Zwischen Hersteller- und Drittanbieter-Messungen bestehen erkennbare Unterschiede in der Aussage:

QuelleAussage zu Qwen3.8-Max
Alibaba (Herstellerangaben)Terminal-Bench 2.1 86,6 · SWE-Bench Pro 67,7 · OSWorld-Verified 86,1 · GPQA Diamond 92,6
Artificial Analysis (unabhängig)58 Punkte im Intelligence Index, Rang 10 von 188 Modellen; zugleich niedrige Ausgabegeschwindigkeit (~45 Token/s) und sehr hoher Token-Verbrauch

Für Qwen3.8-27B liegt seit dem 17. August 2026 ebenfalls eine unabhängige Messung vor: 52 Punkte im Artificial Analysis Intelligence Index (Modus xhigh). Bemerkenswert ist der Größenvergleich – das Modell erreicht diesen Wert mit rund 27,8 Milliarden Parametern, während vergleichbar bewertete offene Modelle deutlich größer sind. Der Wert wird allerdings über sehr lange Reasoning-Ketten erkauft (siehe Einordnung oben).

Bemerkenswert: Der Artificial-Analysis-Wert wurde zwischen erster Messung und späterer Wiederholung mehrfach nach oben korrigiert (53 → 56 → 58). Solche Schwankungen sind ein guter Grund, Benchmark-Ranglisten nicht als alleinige Auswahlgrundlage zu verwenden, sondern gegen die eigene Aufgabenstellung zu testen. Auf LMArena war Qwen3.8-Max nach Medienberichten Anfang August das bestplatzierte chinesische Modell für Textaufgaben.

Qwen 3.7: Vorherige Flaggschiff-Generation (Mai/Juni 2026)

Auf dem Apsara Summit in Hangzhou hat Alibaba am 20. Mai 2026 Qwen3.7-Max vorgestellt – das neue, proprietäre Top-Modell der Qwen-Familie. Am 1. Juni 2026 folgte mit Qwen3.7-Plus die multimodale Agent-Variante zu rund einem Sechstel der Token-Kosten.

Qwen3.7-Max

  • 1 Million Token Kontextfenster – passend für umfangreiche Agent-Workflows mit langen Dokumenten
  • Spitzenwerte (laut Alibaba) auf Terminal-Bench 2.0, SWE-Bench Pro und MCP-Atlas
  • Unterstützung für das Anthropic-Protokoll (MCP)
  • Verfügbar via Alibaba Cloud Model Studio (proprietär, keine Open Weights)

Qwen3.7-Plus

  • Multimodaler Agent (Text, Bild, Video) auf dem Qwen-3.7-Backbone
  • Deep Reasoning, Tool Invocation und autonome Iteration über die Bailian-Plattform
  • Listenpreis um ~1/6 der Qwen3.7-Max-Kosten – attraktiv für vision-lastige Agenten-Workloads
  • Zuerst als Preview auf LM Arena (ca. 14. Mai 2026), GA am 1. Juni 2026

Hinweis: Die Qwen-3.7-Reihe ist weiterhin ausschließlich API-only über Alibaba Cloud verfügbar. Für Self-Hosting empfehlen wir seit August 2026 Qwen3.8-27B (Apache 2.0).

Qwen 3.6: Agentic Real-World AI (April 2026)

Im April 2026 hat Alibaba die Qwen 3.6-Generation veröffentlicht – mit Fokus auf reale Agenten-Workflows:

Qwen3.6-35B-A3B – weiterhin die sparsamste Option

Das effizienteste Modell der Familie nutzt MoE-Architektur (36B total, nur 3B aktiv) und übertrifft dabei Google Gemma 4 in Benchmarks. Apache 2.0 Lizenz ermöglicht uneingeschränktes Self-Hosting. Als allgemeine Open-Weight-Empfehlung wurde es von Qwen3.8-27B abgelöst, bleibt aber die Wahl, wenn Durchsatz pro GPU-Stunde vor Modellqualität geht.

Qwen3.6-27B – Dense Alternative

Mit 28 Milliarden Parametern bietet dieses dichte Modell starke Leistung für Anwendungen, die keine MoE-Architektur unterstützen.

Qwen3.6-Plus und Max-Preview

Die proprietären Modelle sind nur über die API verfügbar und zeigen Alibabas strategische Verschiebung hin zu kommerziellen Angeboten. Qwen3.6-Plus fokussiert sich auf Real-World-Agenten – autonome KI, die reale Aufgaben wie App-Steuerung und Dokumentenbearbeitung ausführt.

Hinweis: Mit Qwen 3.6 bietet Alibaba erstmals proprietäre Modelle an, die nicht als Open Source verfügbar sind. Für Self-Hosting empfehlen wir Qwen3.6-35B-A3B (Apache 2.0).

Qwen-Agent & agentische Qwen-Workflows

Neben den Modellen selbst pflegt das Qwen-Team mit Qwen-Agent (github.com/QwenLM/Qwen-Agent) ein quelloffenes Framework zum Bau von KI-Agenten auf Basis der Qwen-Modelle (ab Qwen 3.0). Es kapselt die typischen Bausteine produktiver Agenten und nimmt Entwicklern den Großteil des Boilerplate-Codes ab:

  • Function Calling / Tool-Use: native Unterstützung für parallele, mehrstufige und mehrschrittige Tool-Aufrufe inklusive automatischem Parsing und Ausführung
  • MCP-Integration: Anbindung externer Tools und Datenquellen (z. B. GitHub, Dateisystem, SQLite) über den offenen Model-Context-Protocol-Standard (MCP)
  • Code Interpreter: Ausführung von Python-Code in einer isolierten Docker-Sandbox
  • RAG über lange Kontexte: Dokumenten-QA über 1M+ Token mittels hybridem RAG und agentenbasierter Zerlegung
  • BrowserQwen: ein Browser-Assistent samt Chrome-Erweiterung als Referenzimplementierung

Das Framework unterstützt u. a. Qwen3, Qwen3-VL, Qwen3-Omni, Qwen3-Coder und QwQ und lässt sich sowohl über die Alibaba-Cloud-API als auch gegen lokale, OpenAI-kompatible Server (vLLM, SGLang) betreiben.

Auf Modellseite treibt Alibaba die agentische Ausrichtung konsequent voran. Qwen3.7-Max wird ausdrücklich als „Agent Frontier" positioniert: Alibaba demonstriert (Stand Juni 2026) lange autonome Läufe – etwa eine 35-stündige Kernel-Optimierung mit über 1.000 Tool-Aufrufen – und meldet Spitzenwerte auf Tool-Use-Benchmarks wie MCP-Mark und Terminal-Bench 2.0. Das Modell fungiert laut Hersteller als austauschbares Backbone für Agent-Frameworks (u. a. Claude Code, Qwen Code, OpenClaw) und unterstützt MCP. Open-Weight-seitig zielt Qwen3.6-35B-A3B explizit auf agentisches Coding und arbeitet z. B. mit dem quelloffenen Terminal-Agenten OpenClaw zusammen.

Souveränität & DSGVO: Den saubersten Weg für agentische Qwen-Workflows im DACH-Raum bietet die Kombination aus offenen Qwen-Gewichten (z. B. Qwen3.8-27B, Apache 2.0) plus Qwen-Agent, vollständig selbst gehostet auf EU-Infrastruktur – so verlassen weder Prompts noch Tool-Daten Ihr Unternehmen. Details dazu im nächsten Abschnitt.

DSGVO: Was beim Einsatz von Qwen zu beachten ist

Qwen ist ein Modell eines chinesischen Anbieters. Für die datenschutzrechtliche Bewertung ist deshalb weniger das Modell selbst entscheidend als die Frage, wo es betrieben wird und wohin Daten dabei fließen.

Self-Hosting in der EU – der unkomplizierteste Weg

Für Qwen3.8-27B und die übrigen Apache-2.0-Modelle gilt: Die Gewichte lassen sich herunterladen und vollständig auf eigener oder europäischer Infrastruktur betreiben (vLLM, SGLang, Ollama, llama.cpp). Es entsteht keine Übermittlung an Alibaba, die Verarbeitung findet ausschließlich in Ihrer Verantwortungssphäre statt. Damit bleiben Prompts, Dokumente und Tool-Aufrufe im eigenen Haus – die Kernanforderung vieler Datenschutzbeauftragter.

Neben eigener Hardware kommen dafür europäische Inferenzanbieter in Frage, die offene Modelle in EU-Rechenzentren betreiben – etwa IONOS AI Model Hub, STACKIT, Scaleway oder Nebius. Welche Qwen-Version dort jeweils im Katalog steht, ändert sich schnell; das sollte vor der Entscheidung konkret geprüft werden.

Nutzung der Alibaba-Cloud-API

Alibaba Cloud Model Studio betreibt eine Region Germany (Frankfurt). Über die Workspace-Einstellung lässt sich dort der Deployment-Scope auf „EU" setzen, wodurch die Inferenz laut Anbieterdokumentation auf die Europäische Union begrenzt wird. Qwen3.8-Max ist in dieser Region gelistet (einzelne Zusatzfunktionen wie die integrierte Websuche sind in Frankfurt allerdings nicht verfügbar).

Sachlich einzuordnen ist Folgendes: Für die Volksrepublik China existiert kein Angemessenheitsbeschluss der EU-Kommission. Eine Übermittlung personenbezogener Daten dorthin ist damit nur unter den Voraussetzungen der Art. 44 ff. DSGVO zulässig – in der Praxis in aller Regel über Standardvertragsklauseln (Art. 46 Abs. 2 lit. c DSGVO) samt Transfer Impact Assessment. Zu berücksichtigen sind dabei auch mögliche Zugriffsbefugnisse nach chinesischem Recht sowie die Frage, ob Support-, Betriebs- oder Administrationszugriffe aus einem Drittland heraus erfolgen können. Ob ein EU-Deployment-Scope diese Fragen im konkreten Fall vollständig ausräumt, hängt von der vertraglichen Ausgestaltung ab und ist im Einzelfall zu bewerten.

Diese Darstellung ist eine allgemeine fachliche Einordnung und ersetzt keine rechtliche Prüfung Ihres konkreten Anwendungsfalls. Für die vertragliche und aufsichtsrechtliche Bewertung ziehen Sie bitte Ihre Rechtsberatung hinzu – gerne begleiten wir den technischen Teil im Rahmen unserer KI-Compliance-Beratung.

Managed-Alternativen mit EU-Datenresidenz

Über AWS Bedrock in Frankfurt (eu-central-1) sind Qwen3-Modelle (u. a. Qwen3-32B und Qwen3-Coder-30B) als vollständig verwaltete Endpunkte verfügbar. Die Qwen-3.8-Generation war dort bei unserer letzten Prüfung (22. August 2026) nicht gelistet; den aktuellen Bedrock-Katalog bitte vor der Entscheidung prüfen. Wer die aktuellen Modelle mit EU-Datenhaltung braucht, kommt daher am Self-Hosting von Qwen3.8-27B kaum vorbei.

QwenWork: Agenten-Plattform vorerst ohne EU-Bezug

Parallel zur 3.8-Generation hat Alibaba am 3. August 2026 die Public Beta von QwenWork gestartet – einer Agenten-Plattform für Arbeitsplatz-Workflows, die Desktop-, Cloud- und Kollaborationsagenten bündelt und auf Qwen 3.8 aufsetzt. Die Beta ist laut Alibaba zunächst in China verfügbar; die Einbettung in DingTalk ist angekündigt. Für DACH-Unternehmen ist QwenWork damit derzeit keine praktikable Bezugsoption – relevant bleibt der Weg über offene Gewichte oder Model Studio.

Qwen 3.5: Die nächste Generation

Native Multimodalität

Qwen 3.5 vereint Text, Bild und Video in einer Architektur:

  • Video-Analyse: Versteht bis zu 2 Stunden Video in einem Prompt
  • Zeitstempel-genau: Identifiziert Ereignisse auf Sekunden-Ebene
  • Lange Kontexte: Bis zu 1 Million Token (ganze Bücher, große Codebases)
  • Flexible Eingabe: URLs, lokale Dateien, Frame-Sequenzen

Agentic AI & Automatisierung

Qwen 3.5 kann autonome Workflows ausführen:

  • App-Interaktion auf Smartphones
  • Dokumentenbearbeitung und E-Mail-Verwaltung
  • Reisebuchungen und Prozessautomatisierung
  • Multi-Step-Tasks mit Tool-Use

Effizienz durch Mixture-of-Experts

Das Qwen3.5-397B-A17B Modell nutzt:

  • 397 Milliarden Parameter total
  • Nur 17 Milliarden aktiv pro Inferenz
  • 60% geringere Kosten als Vorgänger
  • 8-19x höherer Durchsatz als Qwen3

Neu: Qwen 3.5 Small Model Serie (März 2026)

Alibaba hat im März 2026 eine neue Serie kompakter Modelle für Edge- und Mobile-Anwendungen veröffentlicht:

ModellParameterEinsatzbereich
Qwen3.5-9B9 Mrd.Edge-Server, rivalisiert 30B+ Modelle
Qwen3.5-4B4 Mrd.UI-Navigation, Dokumentenanalyse
Qwen3.5-2B2 Mrd.Mobile-Geräte
Qwen3.5-0.8B0,8 Mrd.IoT, Smartphones

Alle Small-Modelle sind nativ multimodal und agentenfähig. Sie eignen sich besonders für On-Device-KI, wo Datenschutz durch lokale Verarbeitung gewährleistet wird.

Qwen3.5-Max-Preview

Mit dem Qwen3.5-Max-Preview führt Alibaba die chinesischen KI-Rankings auf LM Arena an und erreicht Platz 5 weltweit im Mathe-Reasoning.

Besondere Stärken

Offene Gewichte – aber Lizenz prüfen

  • Volle Kontrolle: Modell läuft in Ihrer Infrastruktur
  • Keine Lizenzkosten bei den Apache-2.0-Modellen (u. a. Qwen3.8-27B, Qwen3.6-35B-A3B, Qwen3-Coder), kommerzielle Nutzung erlaubt
  • Anpassbar: Fine-Tuning auf eigene Daten möglich
  • DSGVO-freundlich: Keine Daten verlassen Ihr Unternehmen
  • Ausnahme: Die offenen Gewichte von Qwen3.8-Max stehen unter einer eigenen Lizenz mit Umsatzschwelle für MaaS-Anbieter – hier ist eine gesonderte Prüfung nötig

Erweiterte Mehrsprachigkeit

Qwen 3.5 unterstützt 200+ Sprachen und Dialekte:

  • Chinesisch (herausragend)
  • Europäische Sprachen (sehr gut)
  • Erweiterte Abdeckung: Südasien, Afrika, Ozeanien
  • Konkurrenzfähig mit westlichen Modellen

Text-in-Bild-Generierung

Qwen-Image ist führend bei:

  • Komplexen Text-Layouts
  • Mehrsprachiger Textdarstellung
  • Absatz-level Semantik
  • Feiner Detailarbeit

Verfügbarkeit

WegModelleAnmerkung
Hugging Face / ModelScopeQwen3.8-27B (Apache 2.0), Qwen3.8-Flash-Next (qwen-community-1.0), Qwen3.8-2.4T-A95B (eigene Lizenz), ältere Qwen-GenerationenDownload der Gewichte inkl. FP8-Varianten
Self-HostingvLLM, SGLang, Ollama, llama.cpp, LM Studio262k Kontext nativ, per YaRN bis 1M
Alibaba Cloud Model StudioQwen3.8-Max, Qwen3.8-Flash, Qwen 3.7/3.6/3.5-ReihenRegionen inkl. Germany (Frankfurt), OpenAI-, Anthropic- und DashScope-kompatible Endpunkte; Regionsverfügbarkeit je Modell prüfen
AWS Bedrock (eu-central-1)Qwen3-32B, Qwen3-Coder-30B u. a.Verwaltet und serverless, EU-Datenresidenz; Qwen 3.8 dort nicht gelistet
Google Vertex AI Model GardenQwen3-ModelleKatalogumfang regionsabhängig prüfen
OpenRouterQwen3.8-Max, Qwen3.8-27B u. a.Gerouteter Zugriff über wechselnde Anbieter
EU-Inferenzanbieteroffene Qwen-Modellez. B. IONOS AI Model Hub, STACKIT, Scaleway, Nebius – Katalog vorab prüfen

Preise (Stand 3. September 2026)

ModellInput / 1MOutput / 1MQuelle
Qwen3.8-Max (Frankfurt u. a.)ab $1,65ab $4,951Alibaba Cloud Model Studio
Qwen3.8-Max (Singapur)$2,00$6,00Alibaba Cloud Model Studio
Qwen3.8-Flash (API)ca. $0,15ca. $0,47Drittanbieter (OpenRouter, Artificial Analysis), regional abweichend; Alibaba-Preisliste nicht verifiziert
Qwen3.8-27Bca. $0,40ca. $3,00OpenRouter-Listung, anbieterabhängig
Qwen3.8-27B / Qwen3.8-Flash-Next self-hostedkeine Lizenzgebühren (Apache 2.0 bzw. qwen-community-1.0), nur Infrastruktur

Benchmarks & Leistung

BenchmarkScoreModellHerkunft
Artificial Analysis Intelligence Index58Qwen3.8-Maxunabhängig
Artificial Analysis Intelligence Index56Qwen3.8-Flash-Nextunabhängig
Artificial Analysis Intelligence Index52Qwen3.8-27B (xhigh)unabhängig
SWE-Bench Pro62,5Qwen3.8-Flash-NextHerstellerangabe
LiveCodeBench v691,9Qwen3.8-Flash-NextHerstellerangabe
CoWorkBench73,9Qwen3.8-Flash-NextHerstellerangabe
OSWorld-Verified86,1Qwen3.8-MaxHerstellerangabe
SWE-Bench Pro67,7Qwen3.8-MaxHerstellerangabe
Terminal-Bench 2.186,6Qwen3.8-MaxHerstellerangabe
GPQA Diamond89,2Qwen3.8-27BHerstellerangabe
OSWorld-Verified84,3Qwen3.8-27BHerstellerangabe
SWE-Bench Pro61,7Qwen3.8-27BHerstellerangabe
MMLU90,6 %Qwen3-235B VLHerstellerangabe

Seit dem 17. August 2026 liegt auch für Qwen3.8-27B ein unabhängiger Index-Wert vor (52 Punkte, Modus xhigh). Wir empfehlen weiterhin, Benchmark-Ranglisten als Vorauswahl zu nutzen und die engere Auswahl anschließend an eigenen, repräsentativen Aufgaben zu messen – gerade weil der Wert bei diesem Modell mit sehr hohem Token-Verbrauch erkauft wird und die Kosten pro Aufgabe deshalb von reinen Token-Preisen abweichen.

Hardware-Anforderungen (Self-Hosted)

ModellVRAMEmpfohlene GPU
Qwen3.8-2.4T-A95BRechenzentrums-ClusterMulti-Node (H100/B200-Klasse)
Qwen3.8-Flash-Next (FP8)ab ca. 180 GB für die GewichteMulti-GPU-Knoten (H100/H200-Klasse); N-Gram-Embedding laut Presseberichten auch aus System-RAM bedienbar
Qwen3.8-27B (quantisiert)ab ca. 24 GBRTX 3090 / RTX 4090 / Apple Silicon mit ausreichend Speicher
Qwen3.5-397B-A17B80+ GBH100/MI300X
Qwen3-235B-A22B48+ GBA100/H100
Qwen-Image 20B48+ GBA100/H100
Qwen3 (kleinere Varianten)16-24 GBRTX 4090

Integration mit CompanyGPT

Qwen-Modelle lassen sich in CompanyGPT als selbst gehostete Option einbinden – Qwen3.8-27B eignet sich dafür besonders, weil es unter Apache 2.0 steht und bereits auf einer einzelnen 24-GB-GPU läuft. So bleibt die gesamte Verarbeitung in Ihrer Infrastruktur, ohne Drittlandbezug.

Deprecations & Modellpflege

Alibaba Cloud Model Studio zieht ältere Modelle planmäßig zurück. Laut Anbieterdokumentation gilt eine Vorlaufzeit von 30 Tagen bei Snapshot-Modellen (Modell-IDs mit Datum, z. B. qwen-max-2025-01-25) und drei Monaten bei Hauptlinien-Modellen. Für die Modell-IDs qwen-turbo und qwen-turbo-realtime ist Berichten zufolge eine Abschaltung zum 10. Oktober 2026 angekündigt; als Nachfolger werden die aktuellen Qwen-Reihen empfohlen.

Innerhalb der Qwen-Familie sind die Preview-Builds Qwen3.5-Max-Preview und Qwen3.6-Max-Preview durch die GA-Modelle der Reihen 3.7 und 3.8 abgelöst. Qwen3.8-Flash-Next ist als experimentelle Vorschau ausdrücklich kein GA-Modell; mit Änderungen bis zur Qwen4-Generation ist zu rechnen. Wer über die API arbeitet, sollte Modell-IDs versioniert pinnen und die Sunset-Hinweise im Model Studio aktiv beobachten. Beim Self-Hosting stellt sich das Problem nicht: Einmal heruntergeladene Apache-2.0-Gewichte bleiben unabhängig von der Roadmap des Anbieters nutzbar – ein oft unterschätztes Argument für souveränen Betrieb.

Unsere Empfehlung

Mit Qwen 3.8 trennt Alibaba klar zwischen einem frei nutzbaren Arbeitsmodell, einem lizenzrechtlich eingehegten Flaggschiff und einer experimentellen Architektur-Vorschau. Für DACH-Unternehmen empfehlen wir:

  • Qwen3.8-27B: unser Top-Pick für Self-Hosting – Apache 2.0, multimodal, 262k Kontext, läuft auf einer 24-GB-GPU und inzwischen auch unabhängig gemessen (52 Punkte im Artificial Analysis Intelligence Index). Für die meisten Unternehmensszenarien der beste Ausgangspunkt; reasoning_effort sollte dabei bewusst konfiguriert werden.
  • Qwen3.6-35B-A3B: wenn maximaler Durchsatz pro GPU-Stunde zählt – MoE mit nur 3B aktiven Parametern, ebenfalls Apache 2.0.
  • Qwen3.8-Flash-Next: für die frühe Evaluierung der Qwen4-Architektur – 6B aktive Parameter, multimodal, unabhängig mit 56 Punkten gemessen; Lizenz qwen-community-1.0 vor kommerziellem Einsatz prüfen.
  • Qwen3.8-Max über Model Studio (Frankfurt, Scope „EU"): für Aufgaben, die 1M Kontext und Spitzenleistung brauchen – mit vorheriger datenschutzrechtlicher Prüfung des Drittlandbezugs.
  • Qwen3.8-2.4T-A95B self-hosted: nur mit geprüfter Lizenzlage und Rechenzentrums-Hardware; die offenen Gewichte sind reines Text-Modell.
  • AWS Bedrock Frankfurt: für verwaltete Qwen3-Modelle mit EU-Datenresidenz, wenn die 3.8er-Generation nicht zwingend ist.

Welcher Weg für Sie passt, hängt weniger vom Benchmark-Ranking ab als von Ihren Datenschutz-Anforderungen und der vorhandenen Infrastruktur. Genau diese Abwägung begleiten wir – von der Modellauswahl bis zum produktiven Betrieb.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.