Update September 2026: Der Sommer hat drei Änderungen gebracht. Am 31. Juli 2026 hat DeepSeek deepseek-v4-flash auf den Stand V4-Flash-0731 gehoben (gleiche Architektur, neu post-trainiert für Agenten-Aufgaben). Am 13. August 2026 ist V4-Pro allgemein verfügbar geworden – in App, Web und API, mit Reasoning-Effort low/high/max und nativem Responses-API-Format. Seit dem 21. August 2026 gibt es zusätzlich das experimentelle Vision-Modell deepseek-v4-flash-vision-exp. Parallel hat DeepSeek die API-Preise zum 16. August 2026 angehoben und ein Peak/Off-Peak-Modell eingeführt. Details im Abschnitt „Sommer-Updates 2026". Stand: 3. September 2026.
Update Juni 2026: Seit Mai 2026 sind DeepSeek V4-Flash und V4-Pro auch in Microsoft Foundry verfügbar – damit ist die V4-Generation erstmals über einen Hyperscaler mit EU-Datenresidenz nutzbar. Auf AWS Bedrock sind in EU-Regionen weiterhin V3.1, V3.2 und R1 verfügbar; V4-Pro startet typischerweise zuerst in US-Regionen. innFactory AI Consulting aus Rosenheim berät zu allen Deployment-Optionen.
Update April 2026: DeepSeek hat am 24. April 2026 die V4-Generation veröffentlicht. V4-Flash (284B) und V4-Pro (1,6T Parameter) bieten 1M Token Kontext durch eine neue hybride Attention (Compressed Sparse Attention + Heavily Compressed Attention). Beide Modelle sind als Open Weights auf HuggingFace verfügbar.
Sommer-Updates 2026: V4-Flash-0731, V4-Pro GA und Vision-Exp
V4-Flash-0731 (31. Juli 2026)
- Modell-ID unverändert
deepseek-v4-flash; laut DeepSeek-Dokumentation auf den Stand DeepSeek-V4-Flash-0731 aktualisiert - Architektur und Größe unverändert (284B Parameter, ca. 13B aktiv), laut DeepSeek ausschließlich neu post-trainiert
- Agent-Benchmarks laut DeepSeek: Terminal-Bench 2.1 82,7, NL2Repo 54,2, DeepSWE 54,4, DSBench-Hard 59,6
- Native Unterstützung des Responses-API-Formats, speziell für Codex angepasst
- Ob die Gewichte des Stands 0731 auf Hugging Face veröffentlicht wurden, nennt DeepSeek im Changelog nicht – wir führen das daher nicht als gegeben. Das im April veröffentlichte V4-Flash-Repository steht weiterhin unter MIT-Lizenz.
V4-Pro GA (13. August 2026)
- Allgemeine Verfügbarkeit in App, Web („Expert Mode") und API; Modell-ID bleibt
deepseek-v4-pro, in der Dokumentation als DeepSeek-V4-Pro-0813 geführt - Reasoning-Effort in drei Stufen:
lowfür einfache Aufgaben,highfür den Agenten-Alltag,maxfür komplexe Aufgaben – gilt auch für V4-Flash - Natives Responses-API-Format mit Codex-Anbindung
- Agent-Benchmarks laut DeepSeek: Terminal-Bench 2.1 87,9, NL2Repo 61,5, DeepSWE 62,7, HLE 42,7 (ohne Tools) / 60,0 (mit Tools)
- Offene Gewichte für den Stand 0813: von DeepSeek nicht bestätigt
V4-Flash-Vision-Exp (21. August 2026)
- Modell-ID
deepseek-v4-flash-vision-exp, ausdrücklich experimentell - Bild-Input per Base64, URL oder Files API; Chat Completions, Messages und Responses API
- 1M Token Kontext, bis 384K Output-Tokens (laut Preisübersicht); ein Thinking-Modus ist dort für dieses Modell nicht aufgeführt
- Laut DeepSeek bei reinen Textaufgaben (Agent, Reasoning, Weltwissen) auf dem Niveau von V4-Flash; Benchmarks laut DeepSeek: Terminal-Bench 2.1 83,9, NL2Repo 57,7, DeepSWE 59,3, DSBench-Hard 63,6, Chartography 64,3
- Abrechnung zu V4-Flash-Konditionen; Bilder werden abhängig von den Abmessungen in Tokens umgerechnet (max. 384 Tokens je Bild) und als Input-Tokens berechnet
API-Preise seit 16. August 2026 (16:00 UTC)
DeepSeek rechnet seitdem nach Tageszeit ab. Hauptzeit (Peak) ist Montag bis Freitag 01:00–04:00 und 06:00–10:00 UTC (MESZ: 03:00–06:00 und 08:00–12:00 Uhr); alle übrigen Stunden gelten als Nebenzeit (Off-Peak) mit 50 % Rabatt.
| Modell | Cache Hit | Cache Miss (Input) | Output |
|---|---|---|---|
| V4-Flash / Vision-Exp – Peak | 0,014 USD | 0,44 USD | 1,32 USD |
| V4-Flash / Vision-Exp – Off-Peak | 0,007 USD | 0,22 USD | 0,66 USD |
| V4-Pro – Peak | 0,044 USD | 1,32 USD | 3,96 USD |
| V4-Pro – Off-Peak | 0,022 USD | 0,66 USD | 1,98 USD |
Alle Angaben in USD je 1 Mio. Tokens, Quelle: DeepSeek-Preisübersicht, Stand 3. September 2026. Nach Sekundärquellen lag V4-Flash zuvor flach bei 0,14 USD Input und 0,28 USD Output je 1 Mio. Tokens; DeepSeek selbst nennt die alten Preise im Changelog nicht. Für Batch- und Agenten-Workloads lohnt sich die Verlagerung in die Nebenzeit – aus europäischer Sicht sind das Nachmittag, Abend und Nacht.
DeepSeek V4 - Die neue Generation (April 2026)
DeepSeek hat mit der V4-Generation einen bedeutenden Sprung gemacht:
V4-Flash
- 284B Parameter total, ca. 13B aktiv (MoE)
- 1M Token Kontextfenster
- Thinking- und Non-Thinking-Modus
- API:
deepseek-v4-flash(seit 31.07.2026 Stand 0731, siehe oben) - Open Weights auf HuggingFace (MIT-Lizenz)
V4-Pro
- 1,6 Billionen Parameter total, ca. 49B aktiv (MoE)
- 1M Token Kontextfenster – nur 27 % der FLOPs und 10 % des KV-Caches gegenüber V3.2
- Thinking- und Non-Thinking-Modus
- API:
deepseek-v4-pro(seit 13.08.2026 GA-Stand 0813, siehe oben) - 80,6 % SWE-Bench (laut DeepSeek, April 2026)
Hinweis: Die bisherigen API-Namen
deepseek-chatunddeepseek-reasonerwurden am 24. Juli 2026 eingestellt. Die Preisübersicht führt seitdem nur nochdeepseek-v4-flash,deepseek-v4-prounddeepseek-v4-flash-vision-exp.
Besondere Stärken
Open Source & Lizenzierung
DeepSeek bietet volle Transparenz:
- Öffentliche Gewichte: Vollständig auf GitHub/Hugging Face verfügbar
- Lizenzierung: R1 unter MIT, V3 unter separatem Model Agreement
- Community: Aktive Weiterentwicklung
- Anpassbar: Fine-Tuning und Modifikationen möglich
MoE-Architektur
DeepSeek nutzt innovative Mixture-of-Experts:
- 671B Parameter gesamt, aber nur 37B aktiv pro Anfrage
- Effizient: Hohe Leistung bei reduziertem Ressourcenbedarf
- Multihead Latent Attention: Neuer Attention-Mechanismus
Reasoning-Fähigkeiten (R1)
DeepSeek-R1 zeigt transparente Denkprozesse:
- Chain-of-Thought wird sichtbar gemacht
- Besonders stark bei Mathematik und Logik
- Vergleichbar mit OpenAI o1
EU-Verfügbarkeit (Stand 3. September 2026)
DeepSeek ist über alle drei großen Cloud-Anbieter in EU-Regionen verfügbar. Die Sommer-Updates 0731 und 0813 betreffen zunächst die direkte DeepSeek-API; ob und wann die Hyperscaler-Deployments nachziehen, haben AWS, Microsoft und Google nach unserem Kenntnisstand nicht bestätigt.
AWS Bedrock
- Regionen: Frankfurt (eu-central-1), Ireland (eu-west-1)
- Modelle: DeepSeek-V3.1, V3.2
- Vorteil: Serverless, sofortige Verfügbarkeit
Microsoft Foundry (vormals Azure AI Foundry)
- Regionen: West Europe, Sweden Central
- Modelle: V3, R1, V4-Flash und V4-Pro (seit Mai 2026)
- Vorteil: Integration in Azure-Ökosystem, jetzt mit V4-Generation
Google Vertex AI
- Regionen: Frankfurt (europe-west3), Netherlands (europe-west4)
- Modelle: V3.2, R1
- Vorteil: Vertex AI Model Garden
Self-Hosting
Weiterhin möglich für maximale Kontrolle und vollständige DSGVO-Konformität.
Wichtige Hinweise
Datenschutz-Überlegungen
Update Februar 2026: Mit der Verfügbarkeit auf AWS Bedrock, Azure AI und Google Vertex AI in EU-Regionen können Unternehmen DeepSeek nun DSGVO-konform in der Cloud nutzen!
- Cloud-Hosting (EU): Daten bleiben in EU-Regionen bei AWS/Azure/Google
- Direkte API: DeepSeek-Server in China (Vorsicht bei sensiblen Daten)
- Self-Hosting: Weiterhin die Option mit maximaler Kontrolle
Für Unternehmen: Die Cloud-Provider bieten EU-Datenresidenz mit vollständiger Compliance. Self-Hosting bleibt eine Alternative für höchste Sicherheitsanforderungen.
Self-Hosting als Lösung
Das Open-Source-Modell kann in der eigenen Infrastruktur betrieben werden:
- Alle Daten bleiben unter Ihrer Kontrolle
- Keine Abhängigkeit von externen APIs
- Volle DSGVO-Konformität möglich
- Hardware-Anforderungen: Mehrere High-End GPUs (A100/H100)
Preis-Leistung
DeepSeek bleibt auch nach der Preisanpassung ein preislich attraktives Angebot:
- API: Seit 16.08.2026 Peak/Off-Peak-Preise (siehe Tabelle oben); Cache-Hits und Off-Peak-Nutzung senken die Kosten deutlich
- Self-Hosting: Kostenlos nutzbar (nur Hardware-Kosten) – auf Basis der offenen April-Gewichte
- Keine Lizenzgebühren: R1 und V4-Flash-Repository unter MIT, V3 unter Model Agreement
Unsere Empfehlung (Stand 3. September 2026)
DeepSeek ist technisch beeindruckend und liefert laut Herstellerangaben starke Werte bei Reasoning, Coding und Agenten-Aufgaben. Mit der EU-Verfügbarkeit auf AWS, Azure und Google können Unternehmen DeepSeek DSGVO-konform nutzen.
Für die meisten Unternehmen empfehlen wir:
- Cloud-Option: DeepSeek-V4-Flash (Stand 0731) über einen EU-Cloud-Provider oder – für unkritische Daten – über die direkte API. Bei der API lohnt sich die Verlagerung von Batch-Workloads in die Off-Peak-Zeiten, seit 16.08.2026 halbiert das die Token-Kosten.
- Anspruchsvolle Agenten-Workflows: V4-Pro (GA-Stand 0813) mit Reasoning-Effort
highodermax; die Preise liegen rund dreifach über V4-Flash. - Self-Hosting: DeepSeek-V4-Flash (offene April-Gewichte, MIT) oder V3.2 für maximale Kontrolle und Anpassbarkeit. Ob die Sommer-Stände 0731/0813 als Gewichte erscheinen, hat DeepSeek nicht bestätigt.
- Vision-Exp: Zum Ausprobieren geeignet, für den Produktivbetrieb wegen des experimentellen Status noch nicht.
Die Wahl hängt von Ihren Anforderungen an Kontrolle, Compliance und technische Ressourcen ab.
