Update September 2026: Am 10. September 2026 hat DeepSeek deepseek-flash auf V4.1-Flash aktualisiert – laut eigenem Changelog das „kleinste Modell unserer neuen Architekturfamilie“ mit nativem multimodalem Bildverständnis. Die bisherigen Modelle V4-Flash-0731 und V4-Flash-Vision-Exp wurden dabei zurückgezogen; ihre API-Namen (deepseek-v4-flash, deepseek-v4-flash-vision-exp) routen laut DeepSeek übergangsweise weiter auf V4.1-Flash. Die Preise sind dabei gesunken. V4-Pro bleibt unverändert im Angebot – DeepSeek hat die Fortführung über den 14. September 2026 hinaus zu gleichen Konditionen bestätigt. Davor hatte der Sommer bereits drei Änderungen gebracht (siehe „Sommer-Updates 2026“): den Umstieg auf V4-Flash-0731 am 31. Juli, die GA von V4-Pro am 13. August und das (inzwischen abgelöste) Vision-Modell am 21. August, jeweils mit der Preisumstellung auf Peak/Off-Peak zum 16. August 2026. Bei einer erneuten Prüfung der EU-Verfügbarkeit zeigte sich zudem, dass die Hyperscaler-Optionen enger sind als bisher dargestellt (siehe Abschnitt „EU-Verfügbarkeit“). Stand: 20. September 2026.
Update Juni 2026: Seit Mai 2026 sind DeepSeek V4-Flash und V4-Pro auch in Microsoft Foundry verfügbar – damit ist die V4-Generation erstmals über einen Hyperscaler mit EU-Datenresidenz nutzbar. Auf AWS Bedrock sind in EU-Regionen weiterhin V3.1, V3.2 und R1 verfügbar; V4-Pro startet typischerweise zuerst in US-Regionen. innFactory AI Consulting aus Rosenheim berät zu allen Deployment-Optionen.
Update April 2026: DeepSeek hat am 24. April 2026 die V4-Generation veröffentlicht. V4-Flash (284B) und V4-Pro (1,6T Parameter) bieten 1M Token Kontext durch eine neue hybride Attention (Compressed Sparse Attention + Heavily Compressed Attention). Beide Modelle sind als Open Weights auf HuggingFace verfügbar.
V4.1-Flash löst V4-Flash ab (10. September 2026)
Laut DeepSeeks eigenem Changelog wurde am 10. September 2026 der API-Modellname deepseek-flash auf DeepSeek-V4.1-Flash aktualisiert – beschrieben als „kleinstes Modell unserer neuen Architekturfamilie, mit nativem multimodalem visuellem Verständnis“. Die Architekturänderungen sollen laut DeepSeek „schnellere Inferenz, höheren Durchsatz und Skalierung auf größere Modelle“ ermöglichen.
- Die bisherigen Modelle V4-Flash und V4-Flash-Vision-Exp wurden zurückgezogen; die alten Modellnamen
deepseek-v4-flashunddeepseek-v4-flash-vision-exprouten laut DeepSeek übergangsweise zu Kompatibilitätszwecken weiter auf V4.1-Flash - Preissenkung: Laut DeepSeek-Preisübersicht kostet V4.1-Flash je 1M Token nun 0,003 / 0,006 USD (Cache Hit), 0,15 / 0,30 USD (Input, Cache Miss) und 0,60 / 1,20 USD (Output) – jeweils Off-Peak / Peak
- V4-Pro bleibt bestehen: DeepSeek hat bestätigt, die API für V4-Pro auch über den 14. September 2026 hinaus zu unveränderten Konditionen fortzuführen
- Detaillierte Benchmark-Werte zu V4.1-Flash hat DeepSeek in der uns vorliegenden Dokumentation zum Stand 20. September 2026 nicht veröffentlicht; ob offene Gewichte folgen, ist nicht bestätigt
Quelle: DeepSeek API-Changelog (api-docs.deepseek.com/updates), Stand 20. September 2026.
Sommer-Updates 2026: V4-Flash-0731, V4-Pro GA und Vision-Exp (inzwischen durch V4.1-Flash abgelöst)
V4-Flash-0731 (31. Juli 2026)
- Modell-ID unverändert
deepseek-v4-flash; laut DeepSeek-Dokumentation auf den Stand DeepSeek-V4-Flash-0731 aktualisiert - Architektur und Größe unverändert (284B Parameter, ca. 13B aktiv), laut DeepSeek ausschließlich neu post-trainiert
- Agent-Benchmarks laut DeepSeek: Terminal-Bench 2.1 82,7, NL2Repo 54,2, DeepSWE 54,4, DSBench-Hard 59,6
- Native Unterstützung des Responses-API-Formats, speziell für Codex angepasst
- Ob die Gewichte des Stands 0731 auf Hugging Face veröffentlicht wurden, nennt DeepSeek im Changelog nicht – wir führen das daher nicht als gegeben. Das im April veröffentlichte V4-Flash-Repository steht weiterhin unter MIT-Lizenz.
V4-Pro GA (13. August 2026)
- Allgemeine Verfügbarkeit in App, Web („Expert Mode") und API; Modell-ID bleibt
deepseek-v4-pro, in der Dokumentation als DeepSeek-V4-Pro-0813 geführt - Reasoning-Effort in drei Stufen:
lowfür einfache Aufgaben,highfür den Agenten-Alltag,maxfür komplexe Aufgaben – gilt auch für V4-Flash - Natives Responses-API-Format mit Codex-Anbindung
- Agent-Benchmarks laut DeepSeek: Terminal-Bench 2.1 87,9, NL2Repo 61,5, DeepSWE 62,7, HLE 42,7 (ohne Tools) / 60,0 (mit Tools)
- Offene Gewichte für den Stand 0813: von DeepSeek nicht bestätigt
V4-Flash-Vision-Exp (21. August 2026)
- Modell-ID
deepseek-v4-flash-vision-exp, ausdrücklich experimentell - Bild-Input per Base64, URL oder Files API; Chat Completions, Messages und Responses API
- 1M Token Kontext, bis 384K Output-Tokens (laut Preisübersicht); ein Thinking-Modus ist dort für dieses Modell nicht aufgeführt
- Laut DeepSeek bei reinen Textaufgaben (Agent, Reasoning, Weltwissen) auf dem Niveau von V4-Flash; Benchmarks laut DeepSeek: Terminal-Bench 2.1 83,9, NL2Repo 57,7, DeepSWE 59,3, DSBench-Hard 63,6, Chartography 64,3
- Abrechnung zu V4-Flash-Konditionen; Bilder werden abhängig von den Abmessungen in Tokens umgerechnet (max. 384 Tokens je Bild) und als Input-Tokens berechnet
API-Preise (Stand 20. September 2026)
DeepSeek rechnet seit dem 16. August 2026 (16:00 UTC) nach Tageszeit ab. Hauptzeit (Peak) ist Montag bis Freitag 01:00–04:00 und 06:00–10:00 UTC (MESZ: 03:00–06:00 und 08:00–12:00 Uhr); alle übrigen Stunden gelten als Nebenzeit (Off-Peak) mit 50 % Rabatt.
| Modell | Cache Hit | Cache Miss (Input) | Output |
|---|---|---|---|
| V4.1-Flash – Peak | 0,006 USD | 0,30 USD | 1,20 USD |
| V4.1-Flash – Off-Peak | 0,003 USD | 0,15 USD | 0,60 USD |
| V4-Pro – Peak | 0,044 USD | 1,32 USD | 3,96 USD |
| V4-Pro – Off-Peak | 0,022 USD | 0,66 USD | 1,98 USD |
Alle Angaben in USD je 1 Mio. Tokens, Quelle: DeepSeek-Preisübersicht (api-docs.deepseek.com), Stand 20. September 2026. Die zuvor gültigen V4-Flash-Preise (0,014/0,007 USD Cache Hit, 0,44/0,22 USD Input, 1,32/0,66 USD Output) sind mit dem Wechsel auf V4.1-Flash am 10. September 2026 durch die niedrigeren Werte oben ersetzt worden. Für Batch- und Agenten-Workloads lohnt sich die Verlagerung in die Nebenzeit – aus europäischer Sicht sind das Nachmittag, Abend und Nacht.
DeepSeek V4 - Die neue Generation (April 2026)
DeepSeek hat mit der V4-Generation einen bedeutenden Sprung gemacht:
V4-Flash
- 284B Parameter total, ca. 13B aktiv (MoE)
- 1M Token Kontextfenster
- Thinking- und Non-Thinking-Modus
- API:
deepseek-v4-flash(seit 31.07.2026 Stand 0731, siehe oben) - Open Weights auf HuggingFace (MIT-Lizenz)
V4-Pro
- 1,6 Billionen Parameter total, ca. 49B aktiv (MoE)
- 1M Token Kontextfenster – nur 27 % der FLOPs und 10 % des KV-Caches gegenüber V3.2
- Thinking- und Non-Thinking-Modus
- API:
deepseek-v4-pro(seit 13.08.2026 GA-Stand 0813, siehe oben) - 80,6 % SWE-Bench (laut DeepSeek, April 2026)
Hinweis: Die bisherigen API-Namen
deepseek-chatunddeepseek-reasonerwurden am 24. Juli 2026 eingestellt. Seit dem 10. September 2026 führt die Preisübersichtdeepseek-flash(liefert V4.1-Flash) unddeepseek-v4-pro;deepseek-v4-flash-vision-expwurde zurückgezogen und routet übergangsweise ebenfalls auf V4.1-Flash.
Besondere Stärken
Open Source & Lizenzierung
DeepSeek bietet volle Transparenz:
- Öffentliche Gewichte: Vollständig auf GitHub/Hugging Face verfügbar
- Lizenzierung: R1 unter MIT, V3 unter separatem Model Agreement
- Community: Aktive Weiterentwicklung
- Anpassbar: Fine-Tuning und Modifikationen möglich
MoE-Architektur
DeepSeek nutzt innovative Mixture-of-Experts:
- 671B Parameter gesamt, aber nur 37B aktiv pro Anfrage
- Effizient: Hohe Leistung bei reduziertem Ressourcenbedarf
- Multihead Latent Attention: Neuer Attention-Mechanismus
Reasoning-Fähigkeiten (R1)
DeepSeek-R1 zeigt transparente Denkprozesse:
- Chain-of-Thought wird sichtbar gemacht
- Besonders stark bei Mathematik und Logik
- Vergleichbar mit OpenAI o1
EU-Verfügbarkeit (Stand 20. September 2026)
Die Primärquellen der drei großen Hyperscaler zeigen (Stand 20. September 2026): Echte EU-Datenresidenz für DeepSeek gibt es dort nur in wenigen Konstellationen. Die Sommer- und Herbst-Updates (0731, 0813, V4.1-Flash) betreffen zunächst die direkte DeepSeek-API; ob und wann die Hyperscaler-Deployments nachziehen, haben AWS, Microsoft und Google nach unserem Kenntnisstand nicht bestätigt.
AWS Bedrock
- Regionen (In-Region): Stockholm (eu-north-1) und London (eu-west-2) laut aktuellen Bedrock-Modellkarten – Frankfurt (eu-central-1) und Irland (eu-west-1) sind für DeepSeek dort nicht gelistet. Stockholm liegt in der EU, London im Vereinigten Königreich (außerhalb der EU)
- Modelle: DeepSeek-V3.1 (Modell-ID
deepseek.v3-v1:0bzw.deepseek.v3.1), V3.2 (deepseek.v3.2) – jeweils nur In-Region, kein Geo- oder globales Routing - DeepSeek-R1: auf Bedrock nur in den USA (us-east-1, us-east-2, us-west-2) über die Geo-Region „US“ verfügbar, keine EU-Region
- Vorteil: Serverless, sofortige Verfügbarkeit – allerdings ohne Frankfurt/Irland
Microsoft Foundry (vormals Azure AI Foundry)
- Global Standard (weltweite Verarbeitung, keine Datenresidenz-Garantie): DeepSeek-V3.2, V3.2-Speciale, V4-Flash, V4-Flash-0731 (Preview) und V4-Pro – Ressourcen lassen sich auch in europäischen Regionen anlegen, die Inferenz kann laut Microsoft aber in jeder Azure-Region erfolgen, in der das Modell bereitgestellt ist
- Data Zone Standard EU (Verarbeitung ausschließlich in EU-Mitgliedstaaten): laut aktueller Region-Verfügbarkeitstabelle nur DeepSeek-V4-Flash – nicht V4-Pro, V3.2 oder V3.2-Speciale
- Standard/Regional (strikte Einzelregion): für DeepSeek-Modelle laut Microsoft aktuell nicht verfügbar
- Ältere Einträge zu „V3“ und „R1“ als direkt von Azure verkaufte Modelle finden sich in der aktuellen Übersicht „Foundry Models sold by Azure“ nicht mehr – das sollte gesondert geprüft werden, falls Ihr Deployment darauf aufsetzt
Google Cloud (Gemini Enterprise Agent Platform, vormals Vertex AI)
- Regionen: laut Googles eigener Regionsübersicht (Stand 18.09.2026) DeepSeek-V3.1, DeepSeek-R1 (0528) und DeepSeek-OCR ausschließlich in us-central1 (USA); DeepSeek-V3.2 in der Region „global“ (weltweite Verarbeitung, keine Region eingrenzbar)
- Modelle: V3.1, V3.2, R1 (0528), DeepSeek-OCR als Managed API (MaaS)
- Keine EU-Region: Für DeepSeek bietet Google aktuell keinen europe-west-Standort an – weder Frankfurt (europe-west3) noch die Niederlande (europe-west4) sind gelistet
Self-Hosting
Weiterhin möglich für maximale Kontrolle und vollständige DSGVO-Konformität – angesichts der eingeschränkten Hyperscaler-Optionen aktuell der verlässlichste Weg zu echter EU-Datenresidenz.
Wichtige Hinweise
Datenschutz-Überlegungen
Update September 2026: Laut den Primärquellen der Hyperscaler (Stand 20. September 2026) ist DSGVO-konforme, echte EU-Datenresidenz für DeepSeek eng begrenzt:
- Cloud-Hosting mit echter EU-Datenresidenz: nur in Einzelfällen – auf AWS Bedrock als In-Region-Endpunkt in Stockholm (London liegt außerhalb der EU; Frankfurt und Irland sind nicht gelistet), auf Azure ausschließlich für DeepSeek-V4-Flash über „Data Zone Standard EU“. Auf Google Cloud gibt es aktuell keine EU-Region für DeepSeek.
- Cloud-Hosting ohne Regionsgarantie: Azure „Global Standard“ (V3.2, V4-Pro u. a.) und Google „global“ (V3.2) verarbeiten Daten laut Anbieter weltweit, nicht auf die EU begrenzt
- Direkte API: DeepSeek-Server in China (Vorsicht bei sensiblen Daten)
- Self-Hosting: Die Option mit maximaler Kontrolle und der verlässlichste Weg zu vollständiger EU-Datenresidenz
Für Unternehmen: Prüfen Sie vor jeder Entscheidung das konkrete Modell und den konkreten Deployment-Typ – „verfügbar in der EU“ bedeutet bei DeepSeek derzeit nicht automatisch, dass die Verarbeitung auf die EU begrenzt ist. Self-Hosting bleibt die Option mit der größten Kontrolle.
Self-Hosting als Lösung
Das Open-Source-Modell kann in der eigenen Infrastruktur betrieben werden:
- Alle Daten bleiben unter Ihrer Kontrolle
- Keine Abhängigkeit von externen APIs
- Volle DSGVO-Konformität möglich
- Hardware-Anforderungen: Mehrere High-End GPUs (A100/H100)
Preis-Leistung
DeepSeek bleibt auch nach den Preisanpassungen ein preislich attraktives Angebot:
- API: Seit 10.09.2026 mit V4.1-Flash nochmals günstiger (siehe Tabelle oben); Cache-Hits und Off-Peak-Nutzung senken die Kosten weiter deutlich
- Self-Hosting: Kostenlos nutzbar (nur Hardware-Kosten) – auf Basis der offenen April-Gewichte
- Keine Lizenzgebühren: R1 und V4-Flash-Repository unter MIT, V3 unter Model Agreement
Unsere Empfehlung (Stand 20. September 2026)
DeepSeek ist technisch beeindruckend und liefert laut Herstellerangaben starke Werte bei Reasoning, Coding und Agenten-Aufgaben. Bei der Cloud-Nutzung gilt es aber genau hinzusehen: Echte EU-Datenresidenz bieten AWS, Azure und Google für DeepSeek jeweils nur für einzelne Modelle bzw. Deployment-Typen (siehe Abschnitt „EU-Verfügbarkeit“) – „in Europa nutzbar“ ist nicht gleichbedeutend mit „Daten bleiben in der EU“.
Für die meisten Unternehmen empfehlen wir:
- Cloud-Option mit EU-Datenresidenz: DeepSeek-V4-Flash über Microsoft Foundry mit „Data Zone Standard EU“, oder DeepSeek-V3.1/V3.2 über AWS Bedrock in Stockholm (In-Region). Für unkritische Daten kommt auch die direkte API infrage – bei der API lohnt sich die Verlagerung von Batch-Workloads in die Off-Peak-Zeiten, das halbiert die Token-Kosten.
- Anspruchsvolle Agenten-Workflows: V4-Pro (GA-Stand 0813) mit Reasoning-Effort
highodermax; auf Azure allerdings nur als „Global Standard“ ohne EU-Datenzone. Die Preise liegen rund dreifach über V4.1-Flash. - Self-Hosting: DeepSeek-V4-Flash (offene April-Gewichte, MIT) oder V3.2 für maximale Kontrolle, Anpassbarkeit und die verlässlichste EU-Datenresidenz. Ob die Herbst-/Sommer-Stände (V4.1-Flash, 0813) als Gewichte erscheinen, hat DeepSeek nicht bestätigt.
Die Wahl hängt von Ihren Anforderungen an Kontrolle, Compliance und technische Ressourcen ab – und bei DeepSeek derzeit besonders stark vom konkreten Modell und Deployment-Typ.
