Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM DeepSeek China

DeepSeek

DeepSeek V4-Pro GA (13.08.2026), V4-Flash-0731 und das Vision-Modell: 1M Kontext, Peak/Off-Peak-Preise seit 16.08.2026, EU-Hosting und Empfehlung. Stand: 3. September 2026.

Lizenz MIT (Code), Model Agreement (V3), MIT (R1, V4-Flash-Repository)
DSGVO-Hosting Verfügbar
Kontext 128K-1M Tokens
Modalität Text, Image, Code → Text, Code

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
DeepSeek-V4-Pro-0813 (GA)
13. August 2026
General Availability seit 13.08.2026 in App, Web (Expert Mode) und API – Modell-ID unverändert Reasoning-Effort in drei Stufen (low/high/max) Native Unterstützung des Responses-API-Formats, für Codex angepasst Laut DeepSeek: Terminal-Bench 2.1 87,9, NL2Repo 61,5, DeepSWE 62,7, HLE 42,7 / 60,0 (ohne / mit Tools) 1M Token Kontext, bis 384K Output-Tokens
API-Preise seit 16.08.2026 deutlich höher als zuvor (siehe Preisübersicht) Offene Gewichte für den Stand 0813 im Changelog nicht genannt – von DeepSeek nicht bestätigt Extrem hoher Ressourcenbedarf für Self-Hosting
Aktuell
DeepSeek-V4-Flash-0731 Empfohlen
31. Juli 2026
Gleiche Basis wie V4-Flash (284B Parameter, ca. 13B aktiv) – laut DeepSeek nur neu post-trainiert, Schwerpunkt Agenten-Aufgaben Laut DeepSeek: Terminal-Bench 2.1 82,7, NL2Repo 54,2, DeepSWE 54,4, DSBench-Hard 59,6 Native Unterstützung des Responses-API-Formats, für Codex angepasst Reasoning-Effort low/high/max, 1M Token Kontext, bis 384K Output-Tokens Weiterhin die günstigere V4-Variante
Preiserhöhung zum 16.08.2026 (siehe Preisübersicht) Offene Gewichte für den Stand 0731 im Changelog nicht genannt – von DeepSeek nicht bestätigt
Aktuell
DeepSeek-V4-Flash-Vision-Exp
21. August 2026
Experimentelles multimodales Modell: Bild-Input per Base64, URL oder Files API Laut DeepSeek bei reinen Textaufgaben auf dem Niveau von V4-Flash Laut DeepSeek: Terminal-Bench 2.1 83,9, NL2Repo 57,7, DeepSWE 59,3, DSBench-Hard 63,6, Chartography 64,3 1M Token Kontext, bis 384K Output-Tokens; Chat Completions, Messages und Responses API
Ausdrücklich als experimentell gekennzeichnet – keine Zusagen zu Stabilität oder Laufzeit Thinking-Modus in DeepSeeks Preisübersicht für dieses Modell nicht aufgeführt Keine offenen Gewichte angekündigt
Preview
DeepSeek-V4-Pro (Preview, April 2026)
24. April 2026
1,6 Billionen Parameter (ca. 49B aktiv – MoE) 1M Token Kontextfenster (Compressed Sparse Attention + Heavily Compressed Attention) Thinking und Non-Thinking Modus Open Weights auf HuggingFace Seit Mai 2026 in Microsoft Foundry verfügbar
Extrem hoher Ressourcenbedarf für Self-Hosting EU-Region auf AWS Bedrock noch nicht bestätigt (US-first Rollout) Über die API seit 13.08.2026 durch den Stand 0813 ersetzt
Aktuell
DeepSeek-V4-Flash (Preview, April 2026)
24. April 2026
284B Parameter (ca. 13B aktiv – MoE) 1M Token Kontextfenster Open Weights auf HuggingFace (MIT-Lizenz) Kosteneffiziente Alternative zu V4-Pro Seit Mai 2026 in Microsoft Foundry verfügbar
EU-Region auf AWS Bedrock noch nicht bestätigt Über die API seit 31.07.2026 durch den Stand 0731 ersetzt
Aktuell
DeepSeek-V3.2
Dezember 2025
Aktuelle Generation Open Source (Model Agreement) Jetzt auf AWS, Azure, Vertex AI verfügbar
Ressourcenintensiv
Aktuell
DeepSeek-V3.1
2025
Stabil Auf AWS Bedrock EU verfügbar
Aktuell
DeepSeek-R1
Januar 2025
Reasoning-Fokus MIT-Lizenz
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Coding & Softwareentwicklung
Mathematik & Wissenschaft
Reasoning-Aufgaben
Forschung & Entwicklung
Self-Hosted Deployments
Agentic Workflows

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public
Latenz (TTFT) ~800ms
Features & Capabilities
Tool Use Function Calling Structured Output Vision Reasoning Mode Datei-Upload
Training & Wissen
Wissensstand 2025 (V4)
Fine-Tuning Verfügbar (LoRA, Full, PEFT)
Sprachunterstützung
Beste Qualität Englisch, Chinesisch
Unterstützt 50+ Sprachen
Beste Qualität in Englisch und Chinesisch, gute Qualität in Deutsch

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
AWS
Frankfurt (eu-central-1)
Amazon Bedrock - V3.1/V3.2 verfügbar
Azure
West Europe
Microsoft Foundry - V3/R1 sowie V4-Flash/V4-Pro (seit Mai 2026)
Google Cloud
Frankfurt (europe-west3)
Vertex AI - V3.2/R1 verfügbar
Self-Hosted
Eigene Infrastruktur
Open Source - volle Kontrolle
Lizenz & Hosting
Lizenz MIT (Code), Model Agreement (V3), MIT (R1, V4-Flash-Repository)
Sicherheitsfilter Anpassbar
On-Premise

Benchmarks

Leistungsvergleich mit standardisierten Tests

Terminal-Bench 2.1 (V4-Pro-0813)
87.9
Terminal-Bench 2.1 (V4-Flash-0731)
82.7
Terminal-Bench 2.1 (V4-Flash-Vision-Exp)
83.9
NL2Repo (V4-Pro-0813)
61.5
DeepSWE (V4-Pro-0813)
62.7
HLE mit Tools (V4-Pro-0813)
60.0
SWE-Bench (V4-Pro, April 2026)
80.6%

Update September 2026: Der Sommer hat drei Änderungen gebracht. Am 31. Juli 2026 hat DeepSeek deepseek-v4-flash auf den Stand V4-Flash-0731 gehoben (gleiche Architektur, neu post-trainiert für Agenten-Aufgaben). Am 13. August 2026 ist V4-Pro allgemein verfügbar geworden – in App, Web und API, mit Reasoning-Effort low/high/max und nativem Responses-API-Format. Seit dem 21. August 2026 gibt es zusätzlich das experimentelle Vision-Modell deepseek-v4-flash-vision-exp. Parallel hat DeepSeek die API-Preise zum 16. August 2026 angehoben und ein Peak/Off-Peak-Modell eingeführt. Details im Abschnitt „Sommer-Updates 2026". Stand: 3. September 2026.

Update Juni 2026: Seit Mai 2026 sind DeepSeek V4-Flash und V4-Pro auch in Microsoft Foundry verfügbar – damit ist die V4-Generation erstmals über einen Hyperscaler mit EU-Datenresidenz nutzbar. Auf AWS Bedrock sind in EU-Regionen weiterhin V3.1, V3.2 und R1 verfügbar; V4-Pro startet typischerweise zuerst in US-Regionen. innFactory AI Consulting aus Rosenheim berät zu allen Deployment-Optionen.

Update April 2026: DeepSeek hat am 24. April 2026 die V4-Generation veröffentlicht. V4-Flash (284B) und V4-Pro (1,6T Parameter) bieten 1M Token Kontext durch eine neue hybride Attention (Compressed Sparse Attention + Heavily Compressed Attention). Beide Modelle sind als Open Weights auf HuggingFace verfügbar.

Sommer-Updates 2026: V4-Flash-0731, V4-Pro GA und Vision-Exp

V4-Flash-0731 (31. Juli 2026)

  • Modell-ID unverändert deepseek-v4-flash; laut DeepSeek-Dokumentation auf den Stand DeepSeek-V4-Flash-0731 aktualisiert
  • Architektur und Größe unverändert (284B Parameter, ca. 13B aktiv), laut DeepSeek ausschließlich neu post-trainiert
  • Agent-Benchmarks laut DeepSeek: Terminal-Bench 2.1 82,7, NL2Repo 54,2, DeepSWE 54,4, DSBench-Hard 59,6
  • Native Unterstützung des Responses-API-Formats, speziell für Codex angepasst
  • Ob die Gewichte des Stands 0731 auf Hugging Face veröffentlicht wurden, nennt DeepSeek im Changelog nicht – wir führen das daher nicht als gegeben. Das im April veröffentlichte V4-Flash-Repository steht weiterhin unter MIT-Lizenz.

V4-Pro GA (13. August 2026)

  • Allgemeine Verfügbarkeit in App, Web („Expert Mode") und API; Modell-ID bleibt deepseek-v4-pro, in der Dokumentation als DeepSeek-V4-Pro-0813 geführt
  • Reasoning-Effort in drei Stufen: low für einfache Aufgaben, high für den Agenten-Alltag, max für komplexe Aufgaben – gilt auch für V4-Flash
  • Natives Responses-API-Format mit Codex-Anbindung
  • Agent-Benchmarks laut DeepSeek: Terminal-Bench 2.1 87,9, NL2Repo 61,5, DeepSWE 62,7, HLE 42,7 (ohne Tools) / 60,0 (mit Tools)
  • Offene Gewichte für den Stand 0813: von DeepSeek nicht bestätigt

V4-Flash-Vision-Exp (21. August 2026)

  • Modell-ID deepseek-v4-flash-vision-exp, ausdrücklich experimentell
  • Bild-Input per Base64, URL oder Files API; Chat Completions, Messages und Responses API
  • 1M Token Kontext, bis 384K Output-Tokens (laut Preisübersicht); ein Thinking-Modus ist dort für dieses Modell nicht aufgeführt
  • Laut DeepSeek bei reinen Textaufgaben (Agent, Reasoning, Weltwissen) auf dem Niveau von V4-Flash; Benchmarks laut DeepSeek: Terminal-Bench 2.1 83,9, NL2Repo 57,7, DeepSWE 59,3, DSBench-Hard 63,6, Chartography 64,3
  • Abrechnung zu V4-Flash-Konditionen; Bilder werden abhängig von den Abmessungen in Tokens umgerechnet (max. 384 Tokens je Bild) und als Input-Tokens berechnet

API-Preise seit 16. August 2026 (16:00 UTC)

DeepSeek rechnet seitdem nach Tageszeit ab. Hauptzeit (Peak) ist Montag bis Freitag 01:00–04:00 und 06:00–10:00 UTC (MESZ: 03:00–06:00 und 08:00–12:00 Uhr); alle übrigen Stunden gelten als Nebenzeit (Off-Peak) mit 50 % Rabatt.

ModellCache HitCache Miss (Input)Output
V4-Flash / Vision-Exp – Peak0,014 USD0,44 USD1,32 USD
V4-Flash / Vision-Exp – Off-Peak0,007 USD0,22 USD0,66 USD
V4-Pro – Peak0,044 USD1,32 USD3,96 USD
V4-Pro – Off-Peak0,022 USD0,66 USD1,98 USD

Alle Angaben in USD je 1 Mio. Tokens, Quelle: DeepSeek-Preisübersicht, Stand 3. September 2026. Nach Sekundärquellen lag V4-Flash zuvor flach bei 0,14 USD Input und 0,28 USD Output je 1 Mio. Tokens; DeepSeek selbst nennt die alten Preise im Changelog nicht. Für Batch- und Agenten-Workloads lohnt sich die Verlagerung in die Nebenzeit – aus europäischer Sicht sind das Nachmittag, Abend und Nacht.

DeepSeek V4 - Die neue Generation (April 2026)

DeepSeek hat mit der V4-Generation einen bedeutenden Sprung gemacht:

V4-Flash

  • 284B Parameter total, ca. 13B aktiv (MoE)
  • 1M Token Kontextfenster
  • Thinking- und Non-Thinking-Modus
  • API: deepseek-v4-flash (seit 31.07.2026 Stand 0731, siehe oben)
  • Open Weights auf HuggingFace (MIT-Lizenz)

V4-Pro

  • 1,6 Billionen Parameter total, ca. 49B aktiv (MoE)
  • 1M Token Kontextfenster – nur 27 % der FLOPs und 10 % des KV-Caches gegenüber V3.2
  • Thinking- und Non-Thinking-Modus
  • API: deepseek-v4-pro (seit 13.08.2026 GA-Stand 0813, siehe oben)
  • 80,6 % SWE-Bench (laut DeepSeek, April 2026)

Hinweis: Die bisherigen API-Namen deepseek-chat und deepseek-reasoner wurden am 24. Juli 2026 eingestellt. Die Preisübersicht führt seitdem nur noch deepseek-v4-flash, deepseek-v4-pro und deepseek-v4-flash-vision-exp.

Besondere Stärken

Open Source & Lizenzierung

DeepSeek bietet volle Transparenz:

  • Öffentliche Gewichte: Vollständig auf GitHub/Hugging Face verfügbar
  • Lizenzierung: R1 unter MIT, V3 unter separatem Model Agreement
  • Community: Aktive Weiterentwicklung
  • Anpassbar: Fine-Tuning und Modifikationen möglich

MoE-Architektur

DeepSeek nutzt innovative Mixture-of-Experts:

  • 671B Parameter gesamt, aber nur 37B aktiv pro Anfrage
  • Effizient: Hohe Leistung bei reduziertem Ressourcenbedarf
  • Multihead Latent Attention: Neuer Attention-Mechanismus

Reasoning-Fähigkeiten (R1)

DeepSeek-R1 zeigt transparente Denkprozesse:

  • Chain-of-Thought wird sichtbar gemacht
  • Besonders stark bei Mathematik und Logik
  • Vergleichbar mit OpenAI o1

EU-Verfügbarkeit (Stand 3. September 2026)

DeepSeek ist über alle drei großen Cloud-Anbieter in EU-Regionen verfügbar. Die Sommer-Updates 0731 und 0813 betreffen zunächst die direkte DeepSeek-API; ob und wann die Hyperscaler-Deployments nachziehen, haben AWS, Microsoft und Google nach unserem Kenntnisstand nicht bestätigt.

AWS Bedrock

  • Regionen: Frankfurt (eu-central-1), Ireland (eu-west-1)
  • Modelle: DeepSeek-V3.1, V3.2
  • Vorteil: Serverless, sofortige Verfügbarkeit

Microsoft Foundry (vormals Azure AI Foundry)

  • Regionen: West Europe, Sweden Central
  • Modelle: V3, R1, V4-Flash und V4-Pro (seit Mai 2026)
  • Vorteil: Integration in Azure-Ökosystem, jetzt mit V4-Generation

Google Vertex AI

  • Regionen: Frankfurt (europe-west3), Netherlands (europe-west4)
  • Modelle: V3.2, R1
  • Vorteil: Vertex AI Model Garden

Self-Hosting

Weiterhin möglich für maximale Kontrolle und vollständige DSGVO-Konformität.

Wichtige Hinweise

Datenschutz-Überlegungen

Update Februar 2026: Mit der Verfügbarkeit auf AWS Bedrock, Azure AI und Google Vertex AI in EU-Regionen können Unternehmen DeepSeek nun DSGVO-konform in der Cloud nutzen!

  • Cloud-Hosting (EU): Daten bleiben in EU-Regionen bei AWS/Azure/Google
  • Direkte API: DeepSeek-Server in China (Vorsicht bei sensiblen Daten)
  • Self-Hosting: Weiterhin die Option mit maximaler Kontrolle

Für Unternehmen: Die Cloud-Provider bieten EU-Datenresidenz mit vollständiger Compliance. Self-Hosting bleibt eine Alternative für höchste Sicherheitsanforderungen.

Self-Hosting als Lösung

Das Open-Source-Modell kann in der eigenen Infrastruktur betrieben werden:

  • Alle Daten bleiben unter Ihrer Kontrolle
  • Keine Abhängigkeit von externen APIs
  • Volle DSGVO-Konformität möglich
  • Hardware-Anforderungen: Mehrere High-End GPUs (A100/H100)

Preis-Leistung

DeepSeek bleibt auch nach der Preisanpassung ein preislich attraktives Angebot:

  • API: Seit 16.08.2026 Peak/Off-Peak-Preise (siehe Tabelle oben); Cache-Hits und Off-Peak-Nutzung senken die Kosten deutlich
  • Self-Hosting: Kostenlos nutzbar (nur Hardware-Kosten) – auf Basis der offenen April-Gewichte
  • Keine Lizenzgebühren: R1 und V4-Flash-Repository unter MIT, V3 unter Model Agreement

Unsere Empfehlung (Stand 3. September 2026)

DeepSeek ist technisch beeindruckend und liefert laut Herstellerangaben starke Werte bei Reasoning, Coding und Agenten-Aufgaben. Mit der EU-Verfügbarkeit auf AWS, Azure und Google können Unternehmen DeepSeek DSGVO-konform nutzen.

Für die meisten Unternehmen empfehlen wir:

  • Cloud-Option: DeepSeek-V4-Flash (Stand 0731) über einen EU-Cloud-Provider oder – für unkritische Daten – über die direkte API. Bei der API lohnt sich die Verlagerung von Batch-Workloads in die Off-Peak-Zeiten, seit 16.08.2026 halbiert das die Token-Kosten.
  • Anspruchsvolle Agenten-Workflows: V4-Pro (GA-Stand 0813) mit Reasoning-Effort high oder max; die Preise liegen rund dreifach über V4-Flash.
  • Self-Hosting: DeepSeek-V4-Flash (offene April-Gewichte, MIT) oder V3.2 für maximale Kontrolle und Anpassbarkeit. Ob die Sommer-Stände 0731/0813 als Gewichte erscheinen, hat DeepSeek nicht bestätigt.
  • Vision-Exp: Zum Ausprobieren geeignet, für den Produktivbetrieb wegen des experimentellen Status noch nicht.

Die Wahl hängt von Ihren Anforderungen an Kontrolle, Compliance und technische Ressourcen ab.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.