Als KI-Beratung aus Rosenheim empfehlen wir Qwen-Modelle für Unternehmen, die eine Alternative mit offenen Gewichten suchen. Mit der Qwen 3.8-Generation (August 2026) liefert Alibaba drei sehr unterschiedliche Bausteine: das kompakte, unter Apache 2.0 stehende Qwen3.8-27B für lokalen Betrieb, das MoE-Flaggschiff Qwen3.8-Max mit 2,4 Billionen Parametern – und seit dem 26. August 2026 mit Qwen3.8-Flash-Next eine offene Vorschau auf die Architektur der kommenden Qwen4-Generation. Für den DSGVO-konformen Einsatz im DACH-Raum empfehlen wir Self-Hosting auf EU-Infrastruktur.
Qwen 3.8: Drei Modelle, drei Lizenzen (Stand 3. September 2026)
Die Qwen-3.8-Generation trennt deutlich zwischen einem frei nutzbaren Arbeitspferd, einem lizenzrechtlich eingehegten Flaggschiff und einer experimentellen Architektur-Vorschau mit eigener Community-Lizenz.
Qwen3.8-Flash-Next – offene Vorschau auf die Qwen4-Architektur
Am 26. August 2026 hat das Qwen-Team Qwen3.8-Flash-Next auf Hugging Face und ModelScope veröffentlicht. Das Modell ist laut Model Card eine „experimental preview of the architecture that will underpin Qwen4" – also ausdrücklich kein GA-Modell, sondern ein Blick auf die nächste Generation. Die Eckdaten laut Model Card:
- 125 Milliarden Parameter, davon nur 6 Milliarden aktiv pro Token, ergänzt um ein N-Gram-Embedding mit 51 Milliarden Parametern und ein Multi-Token-Prediction-Modul mit 4 Milliarden Parametern
- 262.144 Token nativer Kontext, per YaRN auf bis zu 1 Million Token erweiterbar
- Multimodal: Text-, Bild- und Videoeingabe
- Lizenz:
qwen-community-1.0– nicht Apache 2.0, auch wenn manche Presseberichte das schreiben. Maßgeblich ist der Lizenztext im Repository. - Herstellerangaben: SWE-bench Pro 62,5 · LiveCodeBench v6 91,9 · CoWorkBench 73,9 · GPQA Diamond 91,7 · MathVision 95,7 · AndroidWorld 84,5
- Ein separater FP8-Checkpoint (Qwen3.8-Flash-Next-FP8) steht unter derselben Lizenz bereit; die Leistung ist laut Qwen nahezu identisch mit dem BF16-Original
Unabhängig gemessen erreicht Qwen3.8-Flash-Next 56 Punkte im Artificial Analysis Intelligence Index v4.1.1 bei rund 86 Token/s Ausgabegeschwindigkeit – erzeugte für den Index allerdings rund 200 Millionen Output-Token. Auch hier gilt: Token-Verbrauch am eigenen Workload messen.
Parallel dazu hat Alibaba Qwen3.8-Flash als Produktions-API über Alibaba Cloud Model Studio angekündigt (Modell-ID qwen3.8-flash). Nach Sekundärquellen bietet die API standardmäßig 1 Million Token Kontext, bis zu 131k Token Ausgabe und Built-in Tools; als Preis nennen Drittanbieter wie OpenRouter und Artificial Analysis rund 0,15 US-Dollar / 1M Input und 0,47 US-Dollar / 1M Output, regional abweichend. Eine öffentlich zugängliche Preisliste von Alibaba Cloud konnten wir zum Stand 3. September 2026 nicht verifizieren – bitte direkt im Model Studio prüfen.
Einordnung: Für Self-Hosting ist Qwen3.8-Flash-Next wegen der 6 Milliarden aktiven Parameter sehr durchsatzstark, benötigt aber Speicher für die vollen rund 180 Milliarden Parameter inklusive Embedding-Tabelle. Wer heute eine produktive, unkompliziert lizenzierte Basis braucht, bleibt bei Qwen3.8-27B (Apache 2.0). Wer die Qwen4-Architektur früh evaluieren will, hat mit Flash-Next dafür einen offenen Kandidaten. Qwen 4 selbst hat Alibaba zum Stand 3. September 2026 nicht angekündigt.
Qwen3.8-27B – unser neuer Open-Weight-Favorit
Am 14. August 2026 hat das Qwen-Team die Gewichte von Qwen3.8-27B auf Hugging Face und ModelScope veröffentlicht – ein dichtes Modell mit rund 27,8 Milliarden Parametern unter Apache 2.0:
- 262.144 Token nativer Kontext, per YaRN-RoPE-Scaling (vLLM, SGLang) auf bis zu 1 Million Token erweiterbar
- Native Bild- und Videoverarbeitung – von STEM-Diagrammen und Dokumenten bis zu stundenlangen Videos
- Thinking-Modus standardmäßig aktiv, aber pro Anfrage abschaltbar; die Reasoning-Tiefe lässt sich über den Parameter
reasoning_effortsteuern - Tool-Calling über die gängigen Inferenz-Frameworks (vLLM, SGLang, Ollama, llama.cpp, LM Studio)
- Herstellerangaben zu Benchmarks: SWE-Bench Pro 61,7 · GPQA Diamond 89,2 · OSWorld-Verified 84,3 · MathVision 94,6
Praktisch entscheidend ist die Größe: Das Modell passt als quantisierte Datei in den Speicher einer 24-GB-Karte (z. B. RTX 3090) oder eines entsprechend ausgestatteten Notebooks. Damit wird ein leistungsfähiges multimodales Modell lokal betreibbar – ohne dass Daten das Unternehmen verlassen.
Einordnung (aktualisiert am 22. August 2026): Die Benchmarkwerte zum Start stammten fast vollständig vom Hersteller. Inzwischen liegt eine unabhängige Messung vor: Artificial Analysis ordnet Qwen3.8-27B im Modus
xhighmit 52 Punkten im Intelligence Index ein und führt es damit als bestplatziertes Open-Weight-Modell seiner Liste. Der Preis dafür ist Rechenzeit: Für den Index erzeugte das Modell rund 160 Millionen Output-Token (Median vergleichbarer Modelle: etwa 45 Millionen) bei einer gemessenen Ausgabegeschwindigkeit von rund 54 Token/s. Das deckt sich mit dem wiederkehrenden Praxisbefund aus der Community: Das Modell denkt im Standardmodus deutlich länger als nötig – wer Latenz und Token-Kosten im Blick hat, solltereasoning_effortaktiv konfigurieren.
Qwen3.8-Max – Flaggschiff mit eigener Lizenz
Qwen3.8-Max ist seit dem 3. August 2026 über Alibaba Cloud Model Studio verfügbar: ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern total und 95 Milliarden aktiven Parametern.
- 1 Million Token Kontextfenster, max. 991.808 Token Eingabe (983.616 im Thinking-Modus), bis 131.072 Token Ausgabe, Chain-of-Thought-Budget 262.144 Token
- Text-, Bild- und Videoeingabe, Ausgabe als Text
- Function Calling und Structured Output werden unterstützt; Batch-Inference und Fine-Tuning nicht
- Regionen: China (Peking), Singapur, Germany (Frankfurt), Japan (Tokio), Hongkong, USA (Virginia)
- Listenpreise laut Alibaba: ab 1,65 US-Dollar / 1M Input und 4,951 US-Dollar / 1M Output; in der Region Singapur 2,00 bzw. 6,00 US-Dollar
Rund zehn Tage nach dem API-Start hat Alibaba auch die Gewichte unter dem Namen Qwen3.8-2.4T-A95B veröffentlicht – erstmals für ein Modell der Max-Klasse. Dabei sind zwei Einschränkungen wichtig:
- Die offenen Gewichte sind reines Text-Modell. Die multimodale Eingabe (Bild, Video) gibt es nur über die API-Variante. Zudem lässt sich der Thinking-Modus in der Open-Weight-Version nicht deaktivieren.
- Nicht Apache 2.0. Statt der bisherigen permissiven Lizenz gilt eine eigene Qwen3.8-Max-Lizenz. Berichten zufolge verlangt sie eine gesonderte kommerzielle Lizenz von Unternehmen, die das Modell in einem „Model as a Service"- oder „AI work assistant"-Geschäft einsetzen und dabei über einen zusammenhängenden Zeitraum von zwölf Monaten mehr als 50 Millionen US-Dollar Umsatz erzielen. Reine interne Nutzung ohne Zugang für Dritte soll davon ausgenommen sein.
Für die Praxis: Für die allermeisten mittelständischen Anwender im DACH-Raum ist die Umsatzschwelle nicht einschlägig. Wer Qwen3.8-2.4T-A95B allerdings als Bestandteil eines eigenen KI-Produkts weiterverkaufen will, sollte den Lizenztext vor dem Rollout juristisch prüfen lassen – Apache-2.0-Erfahrungswerte aus früheren Qwen-Generationen lassen sich hier nicht übertragen.
Unabhängige Bewertung vs. Herstellerangaben
Zwischen Hersteller- und Drittanbieter-Messungen bestehen erkennbare Unterschiede in der Aussage:
| Quelle | Aussage zu Qwen3.8-Max |
|---|---|
| Alibaba (Herstellerangaben) | Terminal-Bench 2.1 86,6 · SWE-Bench Pro 67,7 · OSWorld-Verified 86,1 · GPQA Diamond 92,6 |
| Artificial Analysis (unabhängig) | 58 Punkte im Intelligence Index, Rang 10 von 188 Modellen; zugleich niedrige Ausgabegeschwindigkeit (~45 Token/s) und sehr hoher Token-Verbrauch |
Für Qwen3.8-27B liegt seit dem 17. August 2026 ebenfalls eine unabhängige Messung vor: 52 Punkte im Artificial Analysis Intelligence Index (Modus xhigh). Bemerkenswert ist der Größenvergleich – das Modell erreicht diesen Wert mit rund 27,8 Milliarden Parametern, während vergleichbar bewertete offene Modelle deutlich größer sind. Der Wert wird allerdings über sehr lange Reasoning-Ketten erkauft (siehe Einordnung oben).
Bemerkenswert: Der Artificial-Analysis-Wert wurde zwischen erster Messung und späterer Wiederholung mehrfach nach oben korrigiert (53 → 56 → 58). Solche Schwankungen sind ein guter Grund, Benchmark-Ranglisten nicht als alleinige Auswahlgrundlage zu verwenden, sondern gegen die eigene Aufgabenstellung zu testen. Auf LMArena war Qwen3.8-Max nach Medienberichten Anfang August das bestplatzierte chinesische Modell für Textaufgaben.
Qwen 3.7: Vorherige Flaggschiff-Generation (Mai/Juni 2026)
Auf dem Apsara Summit in Hangzhou hat Alibaba am 20. Mai 2026 Qwen3.7-Max vorgestellt – das neue, proprietäre Top-Modell der Qwen-Familie. Am 1. Juni 2026 folgte mit Qwen3.7-Plus die multimodale Agent-Variante zu rund einem Sechstel der Token-Kosten.
Qwen3.7-Max
- 1 Million Token Kontextfenster – passend für umfangreiche Agent-Workflows mit langen Dokumenten
- Spitzenwerte (laut Alibaba) auf Terminal-Bench 2.0, SWE-Bench Pro und MCP-Atlas
- Unterstützung für das Anthropic-Protokoll (MCP)
- Verfügbar via Alibaba Cloud Model Studio (proprietär, keine Open Weights)
Qwen3.7-Plus
- Multimodaler Agent (Text, Bild, Video) auf dem Qwen-3.7-Backbone
- Deep Reasoning, Tool Invocation und autonome Iteration über die Bailian-Plattform
- Listenpreis um ~1/6 der Qwen3.7-Max-Kosten – attraktiv für vision-lastige Agenten-Workloads
- Zuerst als Preview auf LM Arena (ca. 14. Mai 2026), GA am 1. Juni 2026
Hinweis: Die Qwen-3.7-Reihe ist weiterhin ausschließlich API-only über Alibaba Cloud verfügbar. Für Self-Hosting empfehlen wir seit August 2026 Qwen3.8-27B (Apache 2.0).
Qwen 3.6: Agentic Real-World AI (April 2026)
Im April 2026 hat Alibaba die Qwen 3.6-Generation veröffentlicht – mit Fokus auf reale Agenten-Workflows:
Qwen3.6-35B-A3B – weiterhin die sparsamste Option
Das effizienteste Modell der Familie nutzt MoE-Architektur (36B total, nur 3B aktiv) und übertrifft dabei Google Gemma 4 in Benchmarks. Apache 2.0 Lizenz ermöglicht uneingeschränktes Self-Hosting. Als allgemeine Open-Weight-Empfehlung wurde es von Qwen3.8-27B abgelöst, bleibt aber die Wahl, wenn Durchsatz pro GPU-Stunde vor Modellqualität geht.
Qwen3.6-27B – Dense Alternative
Mit 28 Milliarden Parametern bietet dieses dichte Modell starke Leistung für Anwendungen, die keine MoE-Architektur unterstützen.
Qwen3.6-Plus und Max-Preview
Die proprietären Modelle sind nur über die API verfügbar und zeigen Alibabas strategische Verschiebung hin zu kommerziellen Angeboten. Qwen3.6-Plus fokussiert sich auf Real-World-Agenten – autonome KI, die reale Aufgaben wie App-Steuerung und Dokumentenbearbeitung ausführt.
Hinweis: Mit Qwen 3.6 bietet Alibaba erstmals proprietäre Modelle an, die nicht als Open Source verfügbar sind. Für Self-Hosting empfehlen wir Qwen3.6-35B-A3B (Apache 2.0).
Qwen-Agent & agentische Qwen-Workflows
Neben den Modellen selbst pflegt das Qwen-Team mit Qwen-Agent (github.com/QwenLM/Qwen-Agent) ein quelloffenes Framework zum Bau von KI-Agenten auf Basis der Qwen-Modelle (ab Qwen 3.0). Es kapselt die typischen Bausteine produktiver Agenten und nimmt Entwicklern den Großteil des Boilerplate-Codes ab:
- Function Calling / Tool-Use: native Unterstützung für parallele, mehrstufige und mehrschrittige Tool-Aufrufe inklusive automatischem Parsing und Ausführung
- MCP-Integration: Anbindung externer Tools und Datenquellen (z. B. GitHub, Dateisystem, SQLite) über den offenen Model-Context-Protocol-Standard (MCP)
- Code Interpreter: Ausführung von Python-Code in einer isolierten Docker-Sandbox
- RAG über lange Kontexte: Dokumenten-QA über 1M+ Token mittels hybridem RAG und agentenbasierter Zerlegung
- BrowserQwen: ein Browser-Assistent samt Chrome-Erweiterung als Referenzimplementierung
Das Framework unterstützt u. a. Qwen3, Qwen3-VL, Qwen3-Omni, Qwen3-Coder und QwQ und lässt sich sowohl über die Alibaba-Cloud-API als auch gegen lokale, OpenAI-kompatible Server (vLLM, SGLang) betreiben.
Auf Modellseite treibt Alibaba die agentische Ausrichtung konsequent voran. Qwen3.7-Max wird ausdrücklich als „Agent Frontier" positioniert: Alibaba demonstriert (Stand Juni 2026) lange autonome Läufe – etwa eine 35-stündige Kernel-Optimierung mit über 1.000 Tool-Aufrufen – und meldet Spitzenwerte auf Tool-Use-Benchmarks wie MCP-Mark und Terminal-Bench 2.0. Das Modell fungiert laut Hersteller als austauschbares Backbone für Agent-Frameworks (u. a. Claude Code, Qwen Code, OpenClaw) und unterstützt MCP. Open-Weight-seitig zielt Qwen3.6-35B-A3B explizit auf agentisches Coding und arbeitet z. B. mit dem quelloffenen Terminal-Agenten OpenClaw zusammen.
Souveränität & DSGVO: Den saubersten Weg für agentische Qwen-Workflows im DACH-Raum bietet die Kombination aus offenen Qwen-Gewichten (z. B. Qwen3.8-27B, Apache 2.0) plus Qwen-Agent, vollständig selbst gehostet auf EU-Infrastruktur – so verlassen weder Prompts noch Tool-Daten Ihr Unternehmen. Details dazu im nächsten Abschnitt.
DSGVO: Was beim Einsatz von Qwen zu beachten ist
Qwen ist ein Modell eines chinesischen Anbieters. Für die datenschutzrechtliche Bewertung ist deshalb weniger das Modell selbst entscheidend als die Frage, wo es betrieben wird und wohin Daten dabei fließen.
Self-Hosting in der EU – der unkomplizierteste Weg
Für Qwen3.8-27B und die übrigen Apache-2.0-Modelle gilt: Die Gewichte lassen sich herunterladen und vollständig auf eigener oder europäischer Infrastruktur betreiben (vLLM, SGLang, Ollama, llama.cpp). Es entsteht keine Übermittlung an Alibaba, die Verarbeitung findet ausschließlich in Ihrer Verantwortungssphäre statt. Damit bleiben Prompts, Dokumente und Tool-Aufrufe im eigenen Haus – die Kernanforderung vieler Datenschutzbeauftragter.
Neben eigener Hardware kommen dafür europäische Inferenzanbieter in Frage, die offene Modelle in EU-Rechenzentren betreiben – etwa IONOS AI Model Hub, STACKIT, Scaleway oder Nebius. Welche Qwen-Version dort jeweils im Katalog steht, ändert sich schnell; das sollte vor der Entscheidung konkret geprüft werden.
Nutzung der Alibaba-Cloud-API
Alibaba Cloud Model Studio betreibt eine Region Germany (Frankfurt). Über die Workspace-Einstellung lässt sich dort der Deployment-Scope auf „EU" setzen, wodurch die Inferenz laut Anbieterdokumentation auf die Europäische Union begrenzt wird. Qwen3.8-Max ist in dieser Region gelistet (einzelne Zusatzfunktionen wie die integrierte Websuche sind in Frankfurt allerdings nicht verfügbar).
Sachlich einzuordnen ist Folgendes: Für die Volksrepublik China existiert kein Angemessenheitsbeschluss der EU-Kommission. Eine Übermittlung personenbezogener Daten dorthin ist damit nur unter den Voraussetzungen der Art. 44 ff. DSGVO zulässig – in der Praxis in aller Regel über Standardvertragsklauseln (Art. 46 Abs. 2 lit. c DSGVO) samt Transfer Impact Assessment. Zu berücksichtigen sind dabei auch mögliche Zugriffsbefugnisse nach chinesischem Recht sowie die Frage, ob Support-, Betriebs- oder Administrationszugriffe aus einem Drittland heraus erfolgen können. Ob ein EU-Deployment-Scope diese Fragen im konkreten Fall vollständig ausräumt, hängt von der vertraglichen Ausgestaltung ab und ist im Einzelfall zu bewerten.
Diese Darstellung ist eine allgemeine fachliche Einordnung und ersetzt keine rechtliche Prüfung Ihres konkreten Anwendungsfalls. Für die vertragliche und aufsichtsrechtliche Bewertung ziehen Sie bitte Ihre Rechtsberatung hinzu – gerne begleiten wir den technischen Teil im Rahmen unserer KI-Compliance-Beratung.
Managed-Alternativen mit EU-Datenresidenz
Über AWS Bedrock in Frankfurt (eu-central-1) sind Qwen3-Modelle (u. a. Qwen3-32B und Qwen3-Coder-30B) als vollständig verwaltete Endpunkte verfügbar. Die Qwen-3.8-Generation war dort bei unserer letzten Prüfung (22. August 2026) nicht gelistet; den aktuellen Bedrock-Katalog bitte vor der Entscheidung prüfen. Wer die aktuellen Modelle mit EU-Datenhaltung braucht, kommt daher am Self-Hosting von Qwen3.8-27B kaum vorbei.
QwenWork: Agenten-Plattform vorerst ohne EU-Bezug
Parallel zur 3.8-Generation hat Alibaba am 3. August 2026 die Public Beta von QwenWork gestartet – einer Agenten-Plattform für Arbeitsplatz-Workflows, die Desktop-, Cloud- und Kollaborationsagenten bündelt und auf Qwen 3.8 aufsetzt. Die Beta ist laut Alibaba zunächst in China verfügbar; die Einbettung in DingTalk ist angekündigt. Für DACH-Unternehmen ist QwenWork damit derzeit keine praktikable Bezugsoption – relevant bleibt der Weg über offene Gewichte oder Model Studio.
Qwen 3.5: Die nächste Generation
Native Multimodalität
Qwen 3.5 vereint Text, Bild und Video in einer Architektur:
- Video-Analyse: Versteht bis zu 2 Stunden Video in einem Prompt
- Zeitstempel-genau: Identifiziert Ereignisse auf Sekunden-Ebene
- Lange Kontexte: Bis zu 1 Million Token (ganze Bücher, große Codebases)
- Flexible Eingabe: URLs, lokale Dateien, Frame-Sequenzen
Agentic AI & Automatisierung
Qwen 3.5 kann autonome Workflows ausführen:
- App-Interaktion auf Smartphones
- Dokumentenbearbeitung und E-Mail-Verwaltung
- Reisebuchungen und Prozessautomatisierung
- Multi-Step-Tasks mit Tool-Use
Effizienz durch Mixture-of-Experts
Das Qwen3.5-397B-A17B Modell nutzt:
- 397 Milliarden Parameter total
- Nur 17 Milliarden aktiv pro Inferenz
- 60% geringere Kosten als Vorgänger
- 8-19x höherer Durchsatz als Qwen3
Neu: Qwen 3.5 Small Model Serie (März 2026)
Alibaba hat im März 2026 eine neue Serie kompakter Modelle für Edge- und Mobile-Anwendungen veröffentlicht:
| Modell | Parameter | Einsatzbereich |
|---|---|---|
| Qwen3.5-9B | 9 Mrd. | Edge-Server, rivalisiert 30B+ Modelle |
| Qwen3.5-4B | 4 Mrd. | UI-Navigation, Dokumentenanalyse |
| Qwen3.5-2B | 2 Mrd. | Mobile-Geräte |
| Qwen3.5-0.8B | 0,8 Mrd. | IoT, Smartphones |
Alle Small-Modelle sind nativ multimodal und agentenfähig. Sie eignen sich besonders für On-Device-KI, wo Datenschutz durch lokale Verarbeitung gewährleistet wird.
Qwen3.5-Max-Preview
Mit dem Qwen3.5-Max-Preview führt Alibaba die chinesischen KI-Rankings auf LM Arena an und erreicht Platz 5 weltweit im Mathe-Reasoning.
Besondere Stärken
Offene Gewichte – aber Lizenz prüfen
- Volle Kontrolle: Modell läuft in Ihrer Infrastruktur
- Keine Lizenzkosten bei den Apache-2.0-Modellen (u. a. Qwen3.8-27B, Qwen3.6-35B-A3B, Qwen3-Coder), kommerzielle Nutzung erlaubt
- Anpassbar: Fine-Tuning auf eigene Daten möglich
- DSGVO-freundlich: Keine Daten verlassen Ihr Unternehmen
- Ausnahme: Die offenen Gewichte von Qwen3.8-Max stehen unter einer eigenen Lizenz mit Umsatzschwelle für MaaS-Anbieter – hier ist eine gesonderte Prüfung nötig
Erweiterte Mehrsprachigkeit
Qwen 3.5 unterstützt 200+ Sprachen und Dialekte:
- Chinesisch (herausragend)
- Europäische Sprachen (sehr gut)
- Erweiterte Abdeckung: Südasien, Afrika, Ozeanien
- Konkurrenzfähig mit westlichen Modellen
Text-in-Bild-Generierung
Qwen-Image ist führend bei:
- Komplexen Text-Layouts
- Mehrsprachiger Textdarstellung
- Absatz-level Semantik
- Feiner Detailarbeit
Verfügbarkeit
| Weg | Modelle | Anmerkung |
|---|---|---|
| Hugging Face / ModelScope | Qwen3.8-27B (Apache 2.0), Qwen3.8-Flash-Next (qwen-community-1.0), Qwen3.8-2.4T-A95B (eigene Lizenz), ältere Qwen-Generationen | Download der Gewichte inkl. FP8-Varianten |
| Self-Hosting | vLLM, SGLang, Ollama, llama.cpp, LM Studio | 262k Kontext nativ, per YaRN bis 1M |
| Alibaba Cloud Model Studio | Qwen3.8-Max, Qwen3.8-Flash, Qwen 3.7/3.6/3.5-Reihen | Regionen inkl. Germany (Frankfurt), OpenAI-, Anthropic- und DashScope-kompatible Endpunkte; Regionsverfügbarkeit je Modell prüfen |
| AWS Bedrock (eu-central-1) | Qwen3-32B, Qwen3-Coder-30B u. a. | Verwaltet und serverless, EU-Datenresidenz; Qwen 3.8 dort nicht gelistet |
| Google Vertex AI Model Garden | Qwen3-Modelle | Katalogumfang regionsabhängig prüfen |
| OpenRouter | Qwen3.8-Max, Qwen3.8-27B u. a. | Gerouteter Zugriff über wechselnde Anbieter |
| EU-Inferenzanbieter | offene Qwen-Modelle | z. B. IONOS AI Model Hub, STACKIT, Scaleway, Nebius – Katalog vorab prüfen |
Preise (Stand 3. September 2026)
| Modell | Input / 1M | Output / 1M | Quelle |
|---|---|---|---|
| Qwen3.8-Max (Frankfurt u. a.) | ab $1,65 | ab $4,951 | Alibaba Cloud Model Studio |
| Qwen3.8-Max (Singapur) | $2,00 | $6,00 | Alibaba Cloud Model Studio |
| Qwen3.8-Flash (API) | ca. $0,15 | ca. $0,47 | Drittanbieter (OpenRouter, Artificial Analysis), regional abweichend; Alibaba-Preisliste nicht verifiziert |
| Qwen3.8-27B | ca. $0,40 | ca. $3,00 | OpenRouter-Listung, anbieterabhängig |
| Qwen3.8-27B / Qwen3.8-Flash-Next self-hosted | — | — | keine Lizenzgebühren (Apache 2.0 bzw. qwen-community-1.0), nur Infrastruktur |
Benchmarks & Leistung
| Benchmark | Score | Modell | Herkunft |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 58 | Qwen3.8-Max | unabhängig |
| Artificial Analysis Intelligence Index | 56 | Qwen3.8-Flash-Next | unabhängig |
| Artificial Analysis Intelligence Index | 52 | Qwen3.8-27B (xhigh) | unabhängig |
| SWE-Bench Pro | 62,5 | Qwen3.8-Flash-Next | Herstellerangabe |
| LiveCodeBench v6 | 91,9 | Qwen3.8-Flash-Next | Herstellerangabe |
| CoWorkBench | 73,9 | Qwen3.8-Flash-Next | Herstellerangabe |
| OSWorld-Verified | 86,1 | Qwen3.8-Max | Herstellerangabe |
| SWE-Bench Pro | 67,7 | Qwen3.8-Max | Herstellerangabe |
| Terminal-Bench 2.1 | 86,6 | Qwen3.8-Max | Herstellerangabe |
| GPQA Diamond | 89,2 | Qwen3.8-27B | Herstellerangabe |
| OSWorld-Verified | 84,3 | Qwen3.8-27B | Herstellerangabe |
| SWE-Bench Pro | 61,7 | Qwen3.8-27B | Herstellerangabe |
| MMLU | 90,6 % | Qwen3-235B VL | Herstellerangabe |
Seit dem 17. August 2026 liegt auch für Qwen3.8-27B ein unabhängiger Index-Wert vor (52 Punkte, Modus xhigh). Wir empfehlen weiterhin, Benchmark-Ranglisten als Vorauswahl zu nutzen und die engere Auswahl anschließend an eigenen, repräsentativen Aufgaben zu messen – gerade weil der Wert bei diesem Modell mit sehr hohem Token-Verbrauch erkauft wird und die Kosten pro Aufgabe deshalb von reinen Token-Preisen abweichen.
Hardware-Anforderungen (Self-Hosted)
| Modell | VRAM | Empfohlene GPU |
|---|---|---|
| Qwen3.8-2.4T-A95B | Rechenzentrums-Cluster | Multi-Node (H100/B200-Klasse) |
| Qwen3.8-Flash-Next (FP8) | ab ca. 180 GB für die Gewichte | Multi-GPU-Knoten (H100/H200-Klasse); N-Gram-Embedding laut Presseberichten auch aus System-RAM bedienbar |
| Qwen3.8-27B (quantisiert) | ab ca. 24 GB | RTX 3090 / RTX 4090 / Apple Silicon mit ausreichend Speicher |
| Qwen3.5-397B-A17B | 80+ GB | H100/MI300X |
| Qwen3-235B-A22B | 48+ GB | A100/H100 |
| Qwen-Image 20B | 48+ GB | A100/H100 |
| Qwen3 (kleinere Varianten) | 16-24 GB | RTX 4090 |
Integration mit CompanyGPT
Qwen-Modelle lassen sich in CompanyGPT als selbst gehostete Option einbinden – Qwen3.8-27B eignet sich dafür besonders, weil es unter Apache 2.0 steht und bereits auf einer einzelnen 24-GB-GPU läuft. So bleibt die gesamte Verarbeitung in Ihrer Infrastruktur, ohne Drittlandbezug.
Deprecations & Modellpflege
Alibaba Cloud Model Studio zieht ältere Modelle planmäßig zurück. Laut Anbieterdokumentation gilt eine Vorlaufzeit von 30 Tagen bei Snapshot-Modellen (Modell-IDs mit Datum, z. B. qwen-max-2025-01-25) und drei Monaten bei Hauptlinien-Modellen. Für die Modell-IDs qwen-turbo und qwen-turbo-realtime ist Berichten zufolge eine Abschaltung zum 10. Oktober 2026 angekündigt; als Nachfolger werden die aktuellen Qwen-Reihen empfohlen.
Innerhalb der Qwen-Familie sind die Preview-Builds Qwen3.5-Max-Preview und Qwen3.6-Max-Preview durch die GA-Modelle der Reihen 3.7 und 3.8 abgelöst. Qwen3.8-Flash-Next ist als experimentelle Vorschau ausdrücklich kein GA-Modell; mit Änderungen bis zur Qwen4-Generation ist zu rechnen. Wer über die API arbeitet, sollte Modell-IDs versioniert pinnen und die Sunset-Hinweise im Model Studio aktiv beobachten. Beim Self-Hosting stellt sich das Problem nicht: Einmal heruntergeladene Apache-2.0-Gewichte bleiben unabhängig von der Roadmap des Anbieters nutzbar – ein oft unterschätztes Argument für souveränen Betrieb.
Unsere Empfehlung
Mit Qwen 3.8 trennt Alibaba klar zwischen einem frei nutzbaren Arbeitsmodell, einem lizenzrechtlich eingehegten Flaggschiff und einer experimentellen Architektur-Vorschau. Für DACH-Unternehmen empfehlen wir:
- Qwen3.8-27B: unser Top-Pick für Self-Hosting – Apache 2.0, multimodal, 262k Kontext, läuft auf einer 24-GB-GPU und inzwischen auch unabhängig gemessen (52 Punkte im Artificial Analysis Intelligence Index). Für die meisten Unternehmensszenarien der beste Ausgangspunkt;
reasoning_effortsollte dabei bewusst konfiguriert werden. - Qwen3.6-35B-A3B: wenn maximaler Durchsatz pro GPU-Stunde zählt – MoE mit nur 3B aktiven Parametern, ebenfalls Apache 2.0.
- Qwen3.8-Flash-Next: für die frühe Evaluierung der Qwen4-Architektur – 6B aktive Parameter, multimodal, unabhängig mit 56 Punkten gemessen; Lizenz qwen-community-1.0 vor kommerziellem Einsatz prüfen.
- Qwen3.8-Max über Model Studio (Frankfurt, Scope „EU"): für Aufgaben, die 1M Kontext und Spitzenleistung brauchen – mit vorheriger datenschutzrechtlicher Prüfung des Drittlandbezugs.
- Qwen3.8-2.4T-A95B self-hosted: nur mit geprüfter Lizenzlage und Rechenzentrums-Hardware; die offenen Gewichte sind reines Text-Modell.
- AWS Bedrock Frankfurt: für verwaltete Qwen3-Modelle mit EU-Datenresidenz, wenn die 3.8er-Generation nicht zwingend ist.
Welcher Weg für Sie passt, hängt weniger vom Benchmark-Ranking ab als von Ihren Datenschutz-Anforderungen und der vorhandenen Infrastruktur. Genau diese Abwägung begleiten wir – von der Modellauswahl bis zum produktiven Betrieb.
