innFactory AI Consulting aus Rosenheim unterstützt Unternehmen in Bayern und dem DACH-Raum bei der Nutzung von Google Gemini. Am 2. September 2026 hat Google Gemini 3.8 Flash veröffentlicht – direkt als GA, ohne Preview-Phase, zusammen mit dem zugangsbeschränkten Gemini 3.8 Flash Cyber. Es ist das dritte Flash-Release binnen sechs Wochen: Am 21. Juli 2026 erschienen Gemini 3.6 Flash, 3.5 Flash-Lite und 3.5 Flash Cyber, am 13. August 2026 Gemini 3.7 Flash. Google beschreibt 3.8 Flash als sein bislang intelligentestes Flash-Modell mit „substantial gains from 3.7 Flash". Gemini 3.5 Pro bleibt dagegen weiter unveröffentlicht – ein Pro-Modell oberhalb von Gemini 3.1 Pro gibt es auch im September 2026 nicht.
EU-Verfügbarkeit (Stand 3. September 2026): Bei Gemini lohnt der genaue Blick, weil zwei Google-Dokumente unterschiedlich klingen. Die Gemini-Enterprise-Release-Notes vom 2. September melden Gemini 3.8 Flash als „generally available (GA) in the
global,us, andeuregions" – wie zuvor 3.7 Flash (13. August) und 3.6 Flash (18. August, nun ohne Allowlist). Die Locations- und Data-Residency-Dokumentation (zuletzt aktualisiert am 2. September 2026) führt alle drei Modelle dagegen als „Only available in theglobalregion" – ohne Data Residency at Rest und ohne Machine Learning Processing inusodereu. Beides lässt sich auflösen: Gemini 3.8 Flash ist in einem EU-Deployment auswählbar, Administratoren müssen dabei laut Google-Doku aber eine Warnung bestätigen, dass der Traffic an den globalen Endpoint geroutet wird – ohne regionale Datenresidenz. Eine EU-Verarbeitungszusage gibt es für 3.8, 3.7 und 3.6 Flash damit nicht. Gemini 3.5 Flash bleibt das neueste Gemini-Modell mit vollständiger EU-Data-Residency (DRZ und MLP) und damit unsere Empfehlung für residenzpflichtige Workloads – auch wenn Google es inzwischen selbst als „legacy Flash model" bezeichnet.
Besondere Stärken
Gemini 3.8 Flash – das aktuelle Flash-Modell (GA seit 2. September 2026)
Gemini 3.8 Flash (gemini-3.8-flash) ist seit dem 2. September 2026 direkt als GA verfügbar – ohne vorgelagerte Preview und ohne Preview-Suffix in der Model-ID. Google positioniert es als sein bislang intelligentestes Flash-Modell und betont, dass es bei komplexen Aufgaben „härter arbeitet": Es führe zusätzliche Reasoning-Schritte aus und rufe Werkzeuge iterativ auf. Für die Kostenkalkulation ist das die wichtigste Einordnung, denn der Listenpreis ist identisch mit 3.7 Flash, der Token-Verbrauch pro Aufgabe aber höher (siehe unten).
Die von Google veröffentlichten Benchmark-Werte (Model-Evaluation-PDF, Stand September 2026, pass@1) im Vergleich zu Gemini 3.7 Flash:
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (autonomes Coding) | 73,7 % | 65,3 % |
| Terminal-bench 2.1 | 89,4 % | 85,8 % |
| Terminal-bench 4.0 | 19,1 % | 11,2 % |
| GDPval-AA v2 (Elo) | 1545 | 1482 |
| HLE-Verified | 54,9 % | 53,6 % |
| OSWorld 2.0 (Partial Score) | 59,0 % | 50,6 % |
| LVBench (Video-Verständnis, agentic) | 87,8 % | 85,4 % |
| Vals Finance Agent v2 | 61,4 % | 59,0 % |
| Harvey’s Legal Agent Benchmark | 10,0 % | 8,8 % |
| CharXiv Reasoning | 86,2 % | 84,5 % |
| LABBench2 | 86,2 % | 82,1 % |
Der DeepSWE-Wert wird durch das unabhängige DeepSWE-Leaderboard bestätigt (74 % ± 1). Im Artificial Analysis Intelligence Index erreicht 3.8 Flash 59 Punkte (3.7 Flash: 56, 3.6 Flash: 52). Dieselbe Messung zeigt aber auch: 3.8 Flash erzeugt rund 30 % mehr Output-Token pro Aufgabe als 3.7 Flash, was die Kosten pro Task bei gleichem Listenpreis um etwa 40 % erhöht. Wer von 3.7 auf 3.8 Flash migriert, sollte deshalb die Kosten pro Aufgabe messen, nicht den Token-Preis vergleichen.
Das Kontextfenster liegt bei 1.048.576 Token Input und 65.536 Token Output, der Knowledge Cutoff laut Model Card bei März 2026. Verarbeitet werden Text, Bild, Video, Audio und PDF; die Ausgabe ist ausschließlich Text (keine Live API). Das Reasoning lässt sich über die Thinking-Level low, medium (Default) und high steuern; minimal wird mit einem Fehler abgelehnt, thinking_budget ist durch thinking_level ersetzt. An Werkzeugen stehen Function Calling, Structured Output, Code Execution, File Search, URL Context, Google Search Grounding, Batch, Flex und Priority Inference sowie Computer Use (Preview) bereit. Das am 1. September 2026 vorgestellte Agentic Video Understanding nennt Google ausdrücklich nur für 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite – nicht für 3.8 Flash.
Preise (Gemini API): Bis zum 31. Dezember 2026 gilt derselbe Einführungspreis wie bei 3.7 und 3.6 Flash: $0,75 pro 1M Input-Token und $3,75 pro 1M Output-Token (inklusive Thinking-Token; Caching $0,075; Batch $0,375 / $1,875; Priority $1,35 / $6,75). Ab dem 1. Januar 2027 steigen die Listenpreise auf $1,50 / $7,50 / $0,15. Laut Google gilt der Einführungspreis sowohl in AI Studio als auch auf der Gemini Enterprise Agent Platform. Eine Kontextstaffelung gibt es nicht; Audio-Input wird nicht separat bepreist.
Migrationshinweis: Neben temperature, top_p und top_k ist auch candidate_count deprecated; FunctionResponse-Objekte benötigen call_id und name. Bestehende Integrationen auf 3.5 oder 3.6 Flash, die noch thinking_level: minimal senden, brechen beim Wechsel.
Gemini 3.7 Flash – Vorgängermodell (GA seit 13. August 2026)
Gemini 3.7 Flash (gemini-3.7-flash) ist seit dem 13. August 2026 direkt als GA verfügbar – ohne vorgelagerte Preview. Google positioniert das Modell für Coding, Web-Entwicklung, Wissensarbeit und agentische Workflows und betont, dass die Fortschritte nicht aus einem Neutraining stammen, sondern aus algorithmischen Verbesserungen und ausgewertetem Entwickler-Feedback.
Die von Google veröffentlichten Benchmark-Werte im Vergleich zu Gemini 3.6 Flash:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 (autonomes Coding) | 65,3 % | 49,0 % |
| FrontierCode 1.1 Main | 43,6 % | 34,4 % |
| WebDev Arena (Elo) | 1588 | 1538 |
| Terminal-bench 2.1 | 85,8 % | — |
| Harvey LAB-AA (Legal Reasoning) | 90,7 % | — |
| LVBench (Video-Verständnis) | 85,4 % | — |
Das Kontextfenster liegt bei 1.048.576 Token Input und 65.536 Token Output. Verarbeitet werden Text, Bild, Video, Audio und PDF; das Reasoning lässt sich über die Thinking-Level low, medium und high steuern (ein „minimal"-Level gibt es nicht). An Werkzeugen stehen Function Calling, Structured Output, Code Execution, File Search, Google Search Grounding sowie Computer Use (Preview) bereit. Für Medienworkloads relevant: Seit dem 1. September 2026 ist Agentic Video Understanding für 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite GA – ohne Aufpreis, laut Google mit bis zu 88 % weniger Token, bis zu 66 % geringeren Kosten und bis zu 7 % besserer Genauigkeit auf LongVideoBench.
Preise (Gemini API): Bis zum 31. Dezember 2026 gilt ein Einführungspreis von $0,75 pro 1M Input-Token und $3,75 pro 1M Output-Token (Caching $0,075). Ab dem 1. Januar 2027 steigen die Listenpreise auf $1,50 / $7,50 / $0,15 – wer jetzt kalkuliert, sollte diese Verdopplung in der Wirtschaftlichkeitsrechnung berücksichtigen. Ein limitierter Free Tier ist verfügbar.
Der Knowledge Cutoff liegt laut Model Card bei März 2026. Seit dem 2. September 2026 führt Google 3.7 Flash als Vorgängergeneration; für Neuprojekte ohne Residenzpflicht ist 3.8 Flash die aktuelle Wahl. Migrationshinweis: Die Sampling-Parameter temperature, top_p und top_k sind seit dem 21. Juli 2026 deprecated und gelten auch für 3.7 Flash – bestehende Integrationen sollten geprüft werden.
Gemini 3.6 Flash – Workhorse der Vorgängerstufe (GA seit 21. Juli 2026)
Gemini 3.6 Flash (gemini-3.6-flash) verbessert Coding, Knowledge Work und multimodale Verarbeitung gegenüber 3.5 Flash. Auf dem Coding-Benchmark DeepSWE springt das Modell von 37 auf 49 Prozent, bei OSWorld-Verified (Computer Use) erreicht es 83 Prozent. Gleichzeitig produziert es 17 Prozent weniger Output-Token als 3.5 Flash – Google adressiert damit direkt das Entwickler-Feedback zur Verbosity, was die effektiven Kosten pro Aufgabe zusätzlich senkt. Der Knowledge Cutoff liegt bei März 2026, das Kontextfenster bei 1 Million Token Input (65.536 Output).
Preiskorrektur gegenüber unserem Stand vom 24. Juli: Zum Launch kostete 3.6 Flash $1,50/1M Input und $7,50/1M Output. Inzwischen liegt es – wie 3.7 Flash – beim Einführungspreis von $0,75/1M Input und $3,75/1M Output, befristet bis zum 31. Dezember 2026. Verfügbar ist das Modell über die Gemini API (AI Studio, Android Studio), Antigravity, die Gemini Enterprise Agent Platform und die Gemini App.
Gemini 3.5 Flash-Lite – Speed für Hochvolumen-Workloads (GA seit 21. Juli 2026)
Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) ist das schnellste Modell der 3.5-Serie: 350 Output-Tokens pro Sekunde laut Messung von Artificial Analysis, zu Preisen von $0,30/1M Input und $2,50/1M Output. Damit eignet es sich für Hochvolumen-Automatisierung, Klassifikation und latenzkritische Anwendungen – etwa als Sub-Agent in Multi-Agent-Pipelines. Google rollt das Modell zusätzlich in der Google-Suche aus.
Gemini 3.8 Flash Cyber und das Fairwind Program – Security-Modelle mit beschränktem Zugang
Mit Gemini 3.5 Flash Cyber hatte Google am 21. Juli 2026 erstmals ein dediziertes Cybersecurity-Modell angekündigt, gekoppelt an den CodeMender-Security-Agenten und exklusiv für Regierungen und geprüfte Partner. Am 2. September 2026 folgte der Nachfolger Gemini 3.8 Flash Cyber, der ausschließlich über das neue Fairwind Program bereitgestellt wird – für Regierungen, Betreiber kritischer Infrastruktur und Kern-Technologieplattformen, laut Google mit über 650 Partnern zum Start. Google nennt für 3.8 Flash Cyber unter anderem 86,2 % Pass@1 auf CyberGym (3.5 Flash Cyber: 77,5 %), 71,0 % auf einem internen Schwachstellen-Benchmark über 20 Programmiersprachen (3.7 Flash: 58,9 %) und 47,2 % Pass@1 auf CWE-Bench. Für Unternehmen außerhalb des Programms ist das Modell damit nicht verfügbar, zeigt aber Googles Kurs, sicherheitskritische Fähigkeiten kontrolliert auszurollen – ein Muster, das wir bereits von den Freigabeprozessen bei OpenAI GPT-5.6 und Anthropic Claude Mythos 5.1 kennen.
Gemini 3.5 Flash – Agentic-first
Mit Gemini 3.5 Flash positioniert Google sein schnellstes Modell erstmals oberhalb des eigenen Pro-Flagships: 3.5 Flash übertrifft Gemini 3.1 Pro auf Terminal-Bench 2.1 (Coding), GDPval-AA Elo (Real-World Agentic) und MCP Atlas (Tool Use). Das Modell ist auf mehrstündige autonome Workflows ausgelegt – etwa Coding-Pipelines, Research-Projekte oder den Aufbau ganzer Systeme. Es pausiert an Entscheidungspunkten und holt menschlichen Input ein. Eine kommende Variante soll bis zu 12× schneller als andere Frontier-Modelle bei gleichbleibender Qualität liefern.
Gemini 3.5 Pro – Orchestrator (weiter verschoben)
Gemini 3.5 Pro bleibt auch Anfang September 2026 in Partner-Tests, ohne neuen Termin; der Launch-Blog zu 3.8 Flash erwähnt es nicht. Die Chronologie: angekündigt auf der Google I/O am 19. Mai 2026, das Ziel Juni verfehlt, ein berichtetes Ziel zum 17. Juli ebenfalls verfehlt – am 21. Juli veröffentlichte Google stattdessen drei kleinere Modelle, am 13. August und 2. September zwei weitere Flash-Generationen. Medienberichte (Bloomberg, Axios, Forbes, 9to5google, jeweils 13. August 2026) führen die Verzögerung darauf zurück, dass die Coding-Performance interne Zielwerte nicht erreicht; eine Bestätigung durch Google gibt es dafür nicht.
Konzipiert ist das Modell als Orchestrator/Planner, der Gemini 3.5/3.6/3.7 Flash als Sub-Agenten dirigiert. Angekündigt sind 2M Token Kontextfenster sowie ein Deep-Think-Reasoning-Modus. Praktisch heißt das für Anwender: Das Pro-Flaggschiff ist weiterhin Gemini 3.1 Pro (gemini-3.1-pro-preview, Preview seit 19. Februar 2026, $2/1M Input und $12/1M Output bei bis zu 200k Kontext). Ein Gemini 3.5, 3.6, 3.7 oder 3.8 Pro existiert nicht – die 3.5- bis 3.8-Generationen sind reine Flash-Linien.
Gemini Spark – agentischer 24/7-Assistent
Mit Gemini Spark hat Google auf der I/O 2026 einen agentischen Personal-Assistant vorgestellt; inzwischen basiert er auf Gemini 3.7 Flash. Spark läuft kontinuierlich in Googles Cloud, lässt sich per dedizierter Gmail-Adresse direkt anschreiben und führt Aufgaben über Chrome und Google Workspace im Hintergrund aus. Spark unterstützt das Model Context Protocol (MCP) für die Anbindung externer Dienste.
Für Kunden im DACH-Raum relevant: Google gibt die Verfügbarkeit von Spark mit über 160 Ländern an, nimmt davon aber den EWR, die Schweiz, das Vereinigte Königreich und Nigeria ausdrücklich aus. Das betrifft das Endnutzerprodukt, nicht die API – Gemini 3.7 Flash selbst ist über die Gemini API und die Gemini Enterprise Agent Platform auch aus der EU nutzbar.
Sehr großes Kontextfenster
Gemini 3.1 Pro verarbeitet bis zu 2 Millionen Tokens in einem einzigen Kontext. Damit lassen sich umfangreiche Vertragswerke, technische Dokumentationen oder ganze Codebases in einer Anfrage analysieren. Die Flash-Modelle bieten ein Kontextfenster von 1.048.576 Tokens bei deutlich geringeren Kosten.
Multimodale Verarbeitung
Die Gemini-3.x-Familie verarbeitet Text, Bilder, Audio, Video und PDF-Dokumente nativ. Das ermöglicht Anwendungsfälle wie automatisierte Videoanalyse, Dokumentenextraktion aus gescannten PDFs oder die Auswertung von Meetings mit Audio- und Bildmaterial.
Google-Ökosystem
- Gemini Enterprise Agent Platform (vormals Vertex AI): Enterprise-Deployment mit SLA und Data-Residency-Optionen
- Antigravity: Agentische Entwicklungsplattform für die aktuellen Flash-Modelle
- Gemini Enterprise: Enterprise-Frontend mit Zugriff auf 3.8, 3.7, 3.6 und 3.5 Flash
- Google Workspace: Integration in Docs, Sheets, Gmail und weitere Produkte
- Search Grounding: Zugriff auf aktuelle Webinformationen
- Google AI Studio: Schneller Einstieg und Prototyping
Spezialisierte Varianten
- Gemini 3.1 Flash Thinking: Erweitertes Reasoning für komplexe STEM-Aufgaben mit transparentem Denkprozess
- Gemini 3.1 Pro Deep Research: Spezialisiert auf mehrstufige Recherchen und lange Analyseaufgaben
Die Modellfamilie im September 2026
Die Gemini-Familie ist inzwischen breit gefächert. Für die Auswahl hilft eine Sortierung nach Reifegrad:
Generell verfügbar (GA), mit Listenpreisen pro 1M Token:
| Modell | Input | Output |
|---|---|---|
| Gemini 3.8 Flash | $0,75 (bis 31.12.2026, danach $1,50) | $3,75 (danach $7,50) |
| Gemini 3.7 Flash | $0,75 (bis 31.12.2026, danach $1,50) | $3,75 (danach $7,50) |
| Gemini 3.6 Flash | $0,75 (bis 31.12.2026, danach $1,50) | $3,75 (danach $7,50) |
| Gemini 3.5 Flash | $1,50 | $9,00 |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 |
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 |
Die Gemini-2.5-Reihe (Pro, Flash, Flash-Lite) läuft als Legacy-Generation weiter und ist für EU-Projekte weiterhin relevant, weil sie vollständige Data Residency unterstützt.
Neu seit Ende August 2026: Gemini Omni 1.1 Flash (gemini-omni-1.1-flash, GA seit 27. August 2026) erweitert die Videogenerierung um Scene Extension in 10-Sekunden-Schritten bis 40 Sekunden, First/Last-Frame-Interpolation, einen 360p-Draft-Modus sowie 1080p/4K-Upscaling; abgerechnet wird über Output-Token (5.792 Token pro Sekunde 720p-Video). Die Preview gemini-omni-flash-preview wird am 30. September 2026 abgeschaltet. Gemini 3.5 Transcribe (gemini-3.5-transcribe, Diarisierung, Word-Timestamps, Vokabular-Bias) und Gemini 3.5 Transcribe Live (WebSocket-Streaming) sind seit dem 26. August 2026 verfügbar – der Gemini-API-Changelog spricht von GA, Googles Blog von Public Preview.
In Preview: Gemini 3.1 Pro (das Pro-Flaggschiff), Gemini 3 Flash, Gemini 3.5 Live Translate (über 70 Sprachen), Gemini 3.1 Flash Live, Gemini 3.1 Flash TTS, Deep Research und Deep Research Max, der Antigravity Agent, Gemini Embedding 2 sowie Gemini Robotics ER 2.
Bildmodelle: Nano Banana 2 (gemini-3.1-flash-image), Nano Banana 2 Lite und Nano Banana Pro (gemini-3-pro-image, bis 4K).
Deep Think: Nach uns vorliegenden Sekundärquellen existiert derzeit nur Gemini 3.1 Deep Think, mit Consumer-Zugang über AI Ultra. Ein 3.5 Deep Think gibt es nicht, weil das zugrunde liegende 3.5-Pro-Basismodell fehlt. Eine Gemini-3.x-Nano-Reihe ist uns nicht belegbar bekannt.
Data Residency: DRZ und MLP auseinanderhalten
Der wichtigste Punkt für DSGVO-Projekte mit Gemini ist eine Unterscheidung, die in Googles Dokumentation konsequent durchgehalten wird, in Marketingmaterial aber oft verschwimmt:
- DRZ – Data Residency at Rest: Gespeicherte Daten bleiben in der gewählten Region.
- MLP – Machine Learning Processing: Auch die Verarbeitung durch das Modell findet in der gewählten Region statt.
Erst beides zusammen ergibt eine vollständige EU-Lokalisierung. Ein Modell, für das nur DRZ zugesagt ist, verarbeitet Prompts unter Umständen außerhalb der EU. Genau an dieser Stelle unterscheiden sich die Gemini-Modelle deutlich. Der folgende Stand entstammt Googles Locations-Dokumentation:
| Modell | US-/EU-Multi-Region | In-Country |
|---|---|---|
| Gemini 3.7 Flash | „Only available in the global region" | nein |
| Gemini 3.6 Flash | us: DRZ + MLP mit Allowlist · eu: „Only available in the global region" | nein |
| Gemini 3.5 Flash | DRZ und MLP unterstützt | Indien, Japan, Singapur, UK; Kanada nein |
| Gemini 2.5 Pro | DRZ und MLP unterstützt | Kanada, Japan |
Regionenmodell
Google unterscheidet drei Multi-Regionen: global ist der Default und bietet die beste Performance sowie die neuesten Features – aber keine Residenz-Garantie. Daneben stehen us und eu. Der EU-Multi-Region-Endpoint lautet https://aiplatform.eu.rep.googleapis.com. Zusätzlich gibt es In-Country-Regionen (GA, jeweils mit Allowlist): ca, in, asia-northeast1 (Japan), sg und europe-west2 (UK).
Zero Data Retention
Bei der Gemini API / AI Studio ist ZDR nur für „Paid Services" verfügbar – im Free Tier gibt es kein ZDR. Bei genehmigtem ZDR entfernt Google Prompts, Responses und identifizierende Metadaten vor dem Logging. Auch mit ZDR nicht abschaltbar sind allerdings: Google Search Grounding (30 Tage Speicherung) und Google Maps Grounding (30 Tage). Weitere Speicherung greift standardmäßig bei der Interactions API (Konversationsstatus; erfordert store: false), der Live API (Session-State bis 24 Stunden) und der File API (bis zur Löschung durch den Nutzer).
Auf der Gemini Enterprise Agent Platform ist ZDR laut Anbieter-Dokumentation und Praxisberichten erreichbar, erfordert aber aktive Schritte: Data Caching für Google-Modelle muss deaktiviert und das Abuse-Monitoring-Logging abgeschaltet werden – letzteres per Opt-out über Invoiced Billing oder als Ausnahme über einen Antrag beim Google-Support. Für einige „Advanced AI Features" ist ZDR nach diesen Quellen nicht möglich. Wir behandeln diese Angaben als sekundärbelegt und prüfen sie im Projekt jeweils vertraglich nach.
Die Gemini API ist nicht die Enterprise-Plattform
Die Gemini API / AI Studio ist in über 190 Ländern und damit in der gesamten EU verfügbar, enthält aber keine EU-Data-Residency- und keine DSGVO-spezifischen Zusagen. Google verweist für Compliance-Zusagen ausdrücklich auf die Gemini Enterprise Agent Platform. Für produktive Verarbeitung personenbezogener Daten ist der direkte Weg über AI Studio deshalb in aller Regel nicht der richtige.
Struktureller Verzug bei EU-Regionen
Neue Gemini-Modelle erscheinen zuerst global beziehungsweise in den US-Regionen und erreichen EU-Regionen mit erheblichem Verzug – oder, wie im Fall von 3.6, 3.7 und 3.8 Flash, gar nicht mit vollem MLP. Das ist kein Einzelfall, sondern ein wiederkehrendes Muster, das Entwickler auch in Googles eigenem Developer-Forum dokumentieren. Für die Architekturplanung heißt das: Wer EU-Datenresidenz benötigt, sollte nicht damit rechnen, jeweils das neueste Modell einsetzen zu können, und die Modellauswahl über Konfiguration statt über harte Verdrahtung im Code steuern.
Modell-Lebenszyklus und Deprecations
Google zieht Endpoints in erkennbarem Takt zurück. Für Betreiber produktiver Deployments gehört der Blick auf den Lebenszyklus deshalb in die Betriebsroutine.
Bereits abgeschaltet:
gemini-2.0-flashundgemini-2.0-flash-lite– 1. Juni 2026gemini-3-pro-preview– 9. März 2026gemini-3.1-flash-image-previewundgemini-3-pro-image-preview– 25. Juni 2026Veo-2.0- und Veo-3.0-Endpoints – 30. Juni 2026
imagen-4.0-generate-001samt Ultra- und Fast-Varianten sowie Gemini 3 Image – 17. August 2026Grok-4.1-Modelle auf der Agent Platform – 20. August 2026
gemini-robotics-er-1.6-preview– 31. August 2026 (Nachfolgergemini-robotics-er-2-preview)
Anstehend:
gemini-omni-flash-preview– 30. September 2026 (Nachfolgergemini-omni-1.1-flash)gemini-2.5-flash-image– 2. Oktober 2026- Deprecated Open-Model-Endpoints – 21. Oktober 2026
gemini-3.1-flash-lite– deprecated seit 7. Mai 2026, Shutdown 7. Mai 2027 (Nachfolgergemini-3.5-flash-lite)- Gemini 2.5 Pro / Flash / Flash-Lite: In der Gemini API deprecated, aber ohne Shutdown-Datum. Für die Agent Platform kursiert nach Sekundärquellen ein Retirement im Oktober 2026; Googles Lifecycle-Seite konnten wir nicht direkt verifizieren. Wer 2.5 Pro als EU-Legacy-Option nutzt, sollte die Migration jetzt planen.
- Gemini 3.5 Flash: In der Gemini API seit dem 19. Mai 2026 als deprecated gelistet – ohne Shutdown-Datum, Status weiterhin „Stable".
Parameter-Deprecation: Seit dem 21. Juli 2026 sind die Sampling-Parameter temperature, top_p und top_k deprecated (bei 3.8 Flash zusätzlich candidate_count). Das gilt auch für Gemini 3.7 und 3.8 Flash. Ältere Integrationen, die diese Parameter fest verdrahtet haben, sind beim Modellwechsel ein häufiger Stolperstein – wir empfehlen, Modell-IDs und Request-Parameter zentral zu konfigurieren statt sie im Anwendungscode zu verteilen.
Verfügbarkeit in der EU
Stand 3. September 2026: Gemini 3.5 Flash ist das neueste Gemini-Modell, für das Google sowohl Data Residency at Rest als auch Machine Learning Processing in der EU-Multi-Region dokumentiert (seit dem 31. August 2026 zusätzlich In-Country in Kanada). Anfragen werden innerhalb der EU-Geografie geroutet und sind über das Data Processing Addendum DSGVO-abgedeckt. Gemini 3.8 Flash, 3.7 Flash und 3.6 Flash lassen sich in EU-Deployments zwar auswählen, laufen dabei aber über die globale Region – ohne Residenzzusage. Gemini 3.5 Pro bleibt in Partner-Tests ohne Termin. Neu: Gemini 3.1 Flash Image (Nano Banana 2) ist seit dem 31. August 2026 GA in den Multi-Regionen
usundeu.
Was in der EU heute geht
- Gemini 3.5 Flash über den EU-Multi-Region-Endpoint — mit DRZ und MLP in der EU, GA auf der Gemini Enterprise Agent Platform. Unsere Empfehlung für residenzpflichtige Workloads.
- Gemini 2.5 Pro — Legacy-Generation, ebenfalls mit DRZ und MLP in der EU-Multi-Region; Retirement auf der Agent Platform nach Sekundärquellen im Oktober 2026 (siehe Lebenszyklus).
- Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite über die globale Region — für Workloads ohne Residenzpflicht. In einem EU-Deployment sind die Modelle auswählbar; Administratoren bestätigen dabei laut Google-Doku eine Warnung, dass der Traffic an den globalen Endpoint geht.
Was noch fehlt
- EU-Machine-Learning-Processing für Gemini 3.8 Flash, 3.7 Flash und 3.6 Flash — laut Locations-Dokumentation (Stand 2. September 2026) nur globale Region, obwohl die Release Notes alle drei Modelle als GA in
usundeuführen - Single-Region-Endpoints (europe-west1/3/4) für Gemini 3.8 Flash — von Google nicht dokumentiert
- Dokumentierte EU-Data-Residency für Gemini 3.5 Flash-Lite
- In-Country-Regionen in der EU — für die relevanten Gemini-Modelle listet Google In-Country-Residenz nur außerhalb der EU (Kanada, Indien, Japan, Singapur, UK), nicht in
europe-west3odereurope-west4 - Gemini 3.5 Pro (Partner-Tests, Termin offen) — EU-Verfügbarkeit wird zum GA-Launch bewertet
Wir empfehlen, Googles Locations- und Data-Residency-Dokumentation und die Gemini-Enterprise-Release-Notes regelmäßig zu prüfen — und im Zweifel der Locations-Dokumentation zu folgen, weil sie die Residenz-Zusagen führt.
Einordnung zum EU AI Act
Ergänzend gilt seit dem 2. August 2026 die Durchsetzung der Transparenzpflichten des EU AI Act, mit Bußgeldern von bis zu 3 Prozent des weltweiten Jahresumsatzes. Google hat nach vorliegenden Sekundärquellen den EU AI Act Transparency Code of Practice unterzeichnet und kennzeichnet generierte Inhalte über SynthID-Wasserzeichen. Für die Modellauswahl ist das ein zusätzlicher Prüfpunkt, ersetzt aber die Residenz-Betrachtung nicht.
Integration mit CompanyGPT
Gemini-Modelle sind in CompanyGPT integriert. Gemini 3.5 Flash ist über den EU-Multi-Region-Endpoint für DSGVO-konforme Reasoning- und Agentic-Coding-Workloads angebunden — mit Data Residency at Rest und Machine Learning Processing in der EU. Gemini 2.5 Pro steht als Legacy-Option mit denselben Residenz-Eigenschaften zur Verfügung. Sobald Google EU-MLP für ein neueres Gemini-Modell dokumentiert, ergänzen wir es als Default-Option.
Unsere Empfehlung
Seit dem 2. September 2026 ist Gemini 3.8 Flash das leistungsfähigste GA-Modell von Google. Für die Modellauswahl in EU-Projekten ist aber nicht die Benchmark-Tabelle ausschlaggebend, sondern die Frage, ob der Workload EU-Datenresidenz benötigt:
- Mit EU-Residenzpflicht (personenbezogene Daten, regulierte Branchen): Gemini 3.5 Flash über den EU-Multi-Region-Endpoint. Es ist das neueste Gemini-Modell mit DRZ und MLP in der EU und bleibt damit unsere EU-Empfehlung – auch wenn Google es inzwischen als Legacy-Flash-Modell bezeichnet (ohne Shutdown-Datum).
- Ohne Residenzpflicht, mit Fokus auf Coding und agentische Workflows: Gemini 3.8 Flash über die globale Region — laut Google deutliche Benchmark-Zuwächse gegenüber 3.7 Flash beim Einführungspreis von $0,75/1M Input. Zwei Punkte in der Kalkulation berücksichtigen: den rund 30 % höheren Token-Verbrauch pro Aufgabe (Messung Artificial Analysis) und die Preisverdopplung ab 01.01.2027. Gemini 3.7 Flash bleibt eine Option, wenn der Token-Verbrauch pro Task wichtiger ist als die letzten Benchmark-Punkte.
- Hochvolumen und latenzkritisch: Gemini 3.5 Flash-Lite ($0,30/1M Input, 350 Tokens/s) oder Gemini 3.1 Flash-Lite ($0,25/1M Input) über die globale Region.
- Legacy-Bestand mit EU-Residenz: Gemini 2.5 Pro — technisch überholt, aber mit vollständiger EU-Data-Residency.
- Cross-Cloud-Alternative: Anthropic Claude Opus 5 oder Claude Sonnet 5 (Modellseite) über AWS Bedrock (in-region Irland/Stockholm, Frankfurt über EU-Geo-Inferenz) — sinnvoll für Multi-Cloud-Strategien oder wenn der Workload nicht an Google Cloud gebunden ist. Das am 1. September 2026 veröffentlichte Claude Fable 5.1 läuft mit EU-Datenresidenz über die Europe-Multi-Region der Agent Platform (auf Bedrock nur global), unterliegt aber als Covered Model der 30-Tage-Speicherpflicht.
Sie sind unsicher, welche Variante zu Ihrer Datenschutz-Folgenabschätzung passt? Wir prüfen die Residenz- und Vertragslage im konkreten Projekt und beobachten das EU-Rollout der Gemini-Modelle laufend — diese Seite aktualisieren wir, sobald Google EU-MLP für ein neueres Modell dokumentiert.
