Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM Google USA

Google Gemini

Google Gemini via Vertex AI (Gemini Enterprise Agent Platform) nutzen. Neu seit 2. September 2026: Gemini 3.8 Flash (GA, gemini-3.8-flash, Einführungspreis $0,75/1M Input bis 31.12.2026) und Gemini 3.8 Flash Cyber (nur Fairwind Program). Wichtig für die EU: 3.8, 3.7 und 3.6 Flash sind laut Google-Locations-Doku nur über die globale Region nutzbar, ohne Data Residency – Gemini 3.5 Flash bleibt das neueste Gemini mit EU-Datenresidenz (DRZ + MLP). Stand: 3. September 2026. innFactory AI Consulting Rosenheim.

Lizenz Proprietär
DSGVO-Hosting Verfügbar
Kontext Bis zu 2M Tokens
Modalität Text, Image, Audio, Video, PDF, Code → Text, Image, Audio, Code

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Gemini 3.8 Flash (GA)
2. September 2026
Von Google als bislang intelligentestes Flash-Modell positioniert; drittes Flash-Release binnen sechs Wochen Laut Google-Evaluation: DeepSWE v1.1 73,7 % (3.7 Flash: 65,3 %), Terminal-bench 2.1 89,4 % (85,8 %), Terminal-bench 4.0 19,1 % (11,2 %) HLE-Verified 54,9 % (53,6 %), LVBench 87,8 % agentic (85,4 %), OSWorld 2.0 59,0 % (50,6 %), GDPval-AA v2 Elo 1545 (1482) Vals Finance Agent v2 61,4 %, Harvey's Legal Agent Benchmark 10,0 % (jeweils Angabe Google) Einführungspreis bis 31.12.2026: $0,75/1M Input, $3,75/1M Output (Caching $0,075) – identisch zu 3.7 und 3.6 Flash 1M Token Input-Kontext (1.048.576), 65.536 Output, Knowledge Cutoff März 2026, Thinking-Level low/medium (Default)/high Input: Text, Bild, Video, Audio, PDF; Computer Use (Preview), Batch, Flex und Priority Inference
Keine EU-Data-Residency-Zusage: kein DRZ und kein MLP in 'eu', nur globale Region Laut Google arbeitet das Modell 'härter' und verbraucht bei höheren Effort-Stufen mehr Token – Artificial Analysis misst rund 30 % mehr Output-Token pro Aufgabe als bei 3.7 Flash, also höhere Kosten pro Task trotz gleichem Listenpreis Nur Text-Output, keine Live API; Agentic Video Understanding (GA seit 1. September 2026) nennt Google nur für 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite thinking_level 'minimal' wird abgelehnt; Sampling-Parameter temperature/top_p/top_k/candidate_count deprecated Ab 01.01.2027 verdoppelt sich der Preis auf $1,50/1M Input, $7,50/1M Output
Aktuell
Gemini 3.8 Flash Cyber
Angekündigt 2. September 2026 (Fairwind Program)
Nachfolger von Gemini 3.5 Flash Cyber; laut Google CyberGym Pass@1 86,2 % (3.5 Flash Cyber: 77,5 %) Interner Schwachstellen-Benchmark über 20 Sprachen 71,0 % (3.7 Flash: 58,9 %), CWE-Bench Pass@1 47,2 % (Angaben Google) Fokus auf Schwachstellen-Erkennung und -Behebung
Nur für Fairwind-Teilnehmer – nicht kommerziell verfügbar
Preview
Gemini 3.7 Flash (GA)
13. August 2026
Von Google als Workhorse-Modell für Coding, Web-Dev, Wissensarbeit und agentische Workflows positioniert DeepSWE v1.1 65,3 % (3.6 Flash: 49,0 %), FrontierCode 1.1 Main 43,6 % (34,4 %), WebDev Arena Elo 1588 (1538) Terminal-bench 2.1 85,8 %, Harvey LAB-AA 90,7 %, LVBench 85,4 % Agentic Video Understanding seit 1. September 2026 GA (ohne Aufpreis, laut Google bis zu 88 % weniger Token bei Video-Aufgaben) Einführungspreis bis 31.12.2026: $0,75/1M Input, $3,75/1M Output (Caching $0,075) 1M Token Input-Kontext (1.048.576), 65.536 Output, Thinking-Level low/medium/high, Knowledge Cutoff März 2026 (laut Model Card)
Keine EU-Data-Residency-Zusage: kein DRZ und kein MLP in 'eu', nur globale Region Sampling-Parameter temperature/top_p/top_k sind deprecated – Migration bestehender Prompts prüfen Von Gemini 3.8 Flash (2. September 2026) als aktuelles Flash-Modell abgelöst; Google führt 3.7 Flash als Vorgängergeneration Ab 01.01.2027 verdoppelt sich der Preis auf $1,50/1M Input, $7,50/1M Output
Aktuell
Gemini 3.6 Flash (GA)
21. Juli 2026
Workhorse-Modell: besseres Coding, Knowledge Work und Multimodalität als 3.5 Flash DeepSWE 49 % (Gemini 3.5 Flash: 37 %), OSWorld-Verified 83 % (Computer Use) 17 % weniger Output-Token als 3.5 Flash Einführungspreis bis 31.12.2026 auf $0,75/1M Input, $3,75/1M Output gesenkt (Launch-Preis: $1,50/$7,50) 1M Token Input-Kontext (1.048.576), 65.536 Output, Knowledge Cutoff März 2026
Kein EU-Machine-Learning-Processing – in der EU nur über die globale Region nutzbar Sampling-Parameter temperature/top_p/top_k sind auf 3.6 Flash deprecated – Migration bestehender Prompts prüfen Von Gemini 3.7 Flash (13. August 2026) und 3.8 Flash (2. September 2026) abgelöst
Aktuell
Gemini 3.5 Flash-Lite (GA)
21. Juli 2026
Schnellstes Modell der 3.5-Serie: 350 Output-Tokens/Sekunde (Messung Artificial Analysis) Sehr günstig: $0,30/1M Input, $2,50/1M Output Ideal für Hochvolumen-Automatisierung mit niedriger Latenz
Geringere Kapazität als 3.7 / 3.6 Flash Keine dokumentierte EU-Data-Residency
Aktuell
Gemini 3.5 Flash Cyber
Angekündigt 21. Juli 2026 (Limited-Access-Pilot)
Spezialisiertes Cybersecurity-Modell, gekoppelt an Googles CodeMender-Agenten Fokus auf Schwachstellen-Erkennung und -Behebung
Nur für Regierungen und Trusted Partner – nicht kommerziell verfügbar Seit 2. September 2026 von Gemini 3.8 Flash Cyber (Fairwind Program) abgelöst
Preview
Gemini 3.5 Flash (GA) Empfohlen
19. Mai 2026 (Google I/O 2026)
Neuestes Gemini-Modell mit EU-Data-Residency: DRZ und MLP in der EU-Multi-Region unterstützt Übertrifft Gemini 3.1 Pro auf Terminal-Bench 2.1, GDPval-AA Elo und MCP Atlas 289 Tokens/Sekunde – ca. 4× schneller als andere Frontier-Modelle Agentic-first: mehrstündige autonome Coding- und Research-Pipelines Standardmodell in Gemini App, AI Mode in Search, Antigravity und Gemini Enterprise $1,50/1M Input, $9,00/1M Output
Kein Single-Region-Endpoint in Frankfurt oder Niederlande — nur EU-Multi-Region Auf Coding-Benchmarks von 3.6, 3.7 und 3.8 Flash überholt; Google beschreibt 3.5 Flash inzwischen selbst als Legacy-Flash-Modell (Status weiterhin Stable, Deprecation ohne Shutdown-Datum)
Aktuell
Gemini 3.5 Pro (Limited Preview)
Limited Preview seit Mai 2026, GA-Termin offen
Orchestrator-/Planner-Rolle für Multi-Agent-Workflows Arbeitet mit 3.5/3.6/3.7 Flash als Sub-Agenten zusammen 2M Token Kontextfenster und Deep-Think-Reasoning-Modus angekündigt
GA mehrfach verschoben – Stand 3. September 2026 ohne neuen Termin EU-Verfügbarkeit nicht bestätigt
Preview
Gemini 3.1 Pro (Preview)
Preview seit 19. Februar 2026
Pro-Flaggschiff der Gemini-Familie Komplexes Reasoning, 2M Token Kontextfenster Multimodal; $2/1M Input, $12/1M Output bei bis zu 200k Kontext
Auf zentralen Benchmarks von den neueren Flash-Modellen überholt Preview-Status, keine EU-Data-Residency
Preview
Gemini 3.1 Flash (GA)
Januar 2026
Starkes Preis-Leistungs-Verhältnis 1M Token Kontextfenster
Abgelöst durch Gemini 3.5 Flash
Aktuell
Gemini 3.1 Flash Thinking
Februar 2026
Erweitertes Reasoning Stark bei STEM-Aufgaben
Höhere Latenz durch Denkprozess
Aktuell
Gemini 3.1 Pro Deep Research
Februar 2026
Multi-Hop-Recherche Lange Analyseaufgaben
Spezialisiert, nicht universell
Aktuell
Gemini 3 Pro (Preview)
Januar 2026
Reasoning-first Multimodal
Seit 9. März 2026 abgeschaltet
Veraltet
Gemini 3 Flash (Preview)
Januar 2026
Schnell Stark in multimodalen Aufgaben
Abgelöst durch 3.1 Flash GA
Preview
Gemini 2.5 Pro
2025
Bewährt, EU-Data-Residency mit DRZ und MLP
Legacy-Generation, technisch von der 3.x-Familie überholt
Aktuell
Gemini 2.0 Flash
Dezember 2024
War kosteneffizient
Seit 1. Juni 2026 abgeschaltet
Veraltet

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Video-Analyse
Research & Dokumentenanalyse
Multimodale Anwendungen
Vibe Coding
Agentic Workflows
Datenanalyse
Google Workspace Integration

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public
Requests/Min 1500
Tokens/Min 4000000
Latenz (TTFT) ~300ms
Durchsatz ~200 Tokens/Sek
Features & Capabilities
Tool Use Function Calling Structured Output Vision Reasoning Mode Code Execution Web Browsing Datei-Upload Realtime API
Training & Wissen
Wissensstand 2026-03 (Gemini 3.8 Flash, 3.7 Flash und 3.6 Flash laut Model Cards)
Fine-Tuning Verfügbar (Supervised Fine-Tuning)
Sprachunterstützung
Beste Qualität Englisch, Deutsch, Französisch, Spanisch, Japanisch, Koreanisch, Chinesisch
Unterstützt 100+ Sprachen
Exzellente Mehrsprachigkeit durch multimodales Training

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Google Cloud
EU-Multi-Region (aiplatform.eu.rep.googleapis.com)
Gemini Enterprise Agent Platform (vormals Vertex AI). Data Residency at Rest (DRZ) und Machine Learning Processing (MLP) in der EU sind laut Googles Locations-Dokumentation für Gemini 3.5 Flash und Gemini 2.5 Pro dokumentiert, nicht für Gemini 3.6, 3.7 und 3.8 Flash.
Lizenz & Hosting
Lizenz Proprietary
Sicherheitsfilter Anpassbar
Enterprise Support Ja
SLA verfügbar Ja
Nur Cloud

Benchmarks

Leistungsvergleich mit standardisierten Tests

DeepSWE v1.1 (Gemini 3.8 Flash)
73.7%
Terminal-bench 2.1 (Gemini 3.8 Flash)
89.4%
Terminal-bench 4.0 (Gemini 3.8 Flash)
19.1%
HLE-Verified (Gemini 3.8 Flash)
54.9%
OSWorld 2.0 (Gemini 3.8 Flash)
59.0%
LVBench (Gemini 3.8 Flash)
87.8%
GDPval-AA v2 (Gemini 3.8 Flash)
1545
Artificial Analysis Intelligence Index (Gemini 3.8 Flash)
59
DeepSWE v1.1 (Gemini 3.7 Flash)
65.3
Terminal-bench 2.1 (Gemini 3.7 Flash)
85.8
FrontierCode 1.1 Main (Gemini 3.7 Flash)
43.6
Harvey LAB-AA (Gemini 3.7 Flash)
90.7
LVBench (Gemini 3.7 Flash)
85.4
OSWorld-Verified (Gemini 3.6 Flash)
83

innFactory AI Consulting aus Rosenheim unterstützt Unternehmen in Bayern und dem DACH-Raum bei der Nutzung von Google Gemini. Am 2. September 2026 hat Google Gemini 3.8 Flash veröffentlicht – direkt als GA, ohne Preview-Phase, zusammen mit dem zugangsbeschränkten Gemini 3.8 Flash Cyber. Es ist das dritte Flash-Release binnen sechs Wochen: Am 21. Juli 2026 erschienen Gemini 3.6 Flash, 3.5 Flash-Lite und 3.5 Flash Cyber, am 13. August 2026 Gemini 3.7 Flash. Google beschreibt 3.8 Flash als sein bislang intelligentestes Flash-Modell mit „substantial gains from 3.7 Flash". Gemini 3.5 Pro bleibt dagegen weiter unveröffentlicht – ein Pro-Modell oberhalb von Gemini 3.1 Pro gibt es auch im September 2026 nicht.

EU-Verfügbarkeit (Stand 3. September 2026): Bei Gemini lohnt der genaue Blick, weil zwei Google-Dokumente unterschiedlich klingen. Die Gemini-Enterprise-Release-Notes vom 2. September melden Gemini 3.8 Flash als „generally available (GA) in the global, us, and eu regions" – wie zuvor 3.7 Flash (13. August) und 3.6 Flash (18. August, nun ohne Allowlist). Die Locations- und Data-Residency-Dokumentation (zuletzt aktualisiert am 2. September 2026) führt alle drei Modelle dagegen als „Only available in the global region" – ohne Data Residency at Rest und ohne Machine Learning Processing in us oder eu. Beides lässt sich auflösen: Gemini 3.8 Flash ist in einem EU-Deployment auswählbar, Administratoren müssen dabei laut Google-Doku aber eine Warnung bestätigen, dass der Traffic an den globalen Endpoint geroutet wird – ohne regionale Datenresidenz. Eine EU-Verarbeitungszusage gibt es für 3.8, 3.7 und 3.6 Flash damit nicht. Gemini 3.5 Flash bleibt das neueste Gemini-Modell mit vollständiger EU-Data-Residency (DRZ und MLP) und damit unsere Empfehlung für residenzpflichtige Workloads – auch wenn Google es inzwischen selbst als „legacy Flash model" bezeichnet.

Besondere Stärken

Gemini 3.8 Flash – das aktuelle Flash-Modell (GA seit 2. September 2026)

Gemini 3.8 Flash (gemini-3.8-flash) ist seit dem 2. September 2026 direkt als GA verfügbar – ohne vorgelagerte Preview und ohne Preview-Suffix in der Model-ID. Google positioniert es als sein bislang intelligentestes Flash-Modell und betont, dass es bei komplexen Aufgaben „härter arbeitet": Es führe zusätzliche Reasoning-Schritte aus und rufe Werkzeuge iterativ auf. Für die Kostenkalkulation ist das die wichtigste Einordnung, denn der Listenpreis ist identisch mit 3.7 Flash, der Token-Verbrauch pro Aufgabe aber höher (siehe unten).

Die von Google veröffentlichten Benchmark-Werte (Model-Evaluation-PDF, Stand September 2026, pass@1) im Vergleich zu Gemini 3.7 Flash:

BenchmarkGemini 3.8 FlashGemini 3.7 Flash
DeepSWE v1.1 (autonomes Coding)73,7 %65,3 %
Terminal-bench 2.189,4 %85,8 %
Terminal-bench 4.019,1 %11,2 %
GDPval-AA v2 (Elo)15451482
HLE-Verified54,9 %53,6 %
OSWorld 2.0 (Partial Score)59,0 %50,6 %
LVBench (Video-Verständnis, agentic)87,8 %85,4 %
Vals Finance Agent v261,4 %59,0 %
Harvey’s Legal Agent Benchmark10,0 %8,8 %
CharXiv Reasoning86,2 %84,5 %
LABBench286,2 %82,1 %

Der DeepSWE-Wert wird durch das unabhängige DeepSWE-Leaderboard bestätigt (74 % ± 1). Im Artificial Analysis Intelligence Index erreicht 3.8 Flash 59 Punkte (3.7 Flash: 56, 3.6 Flash: 52). Dieselbe Messung zeigt aber auch: 3.8 Flash erzeugt rund 30 % mehr Output-Token pro Aufgabe als 3.7 Flash, was die Kosten pro Task bei gleichem Listenpreis um etwa 40 % erhöht. Wer von 3.7 auf 3.8 Flash migriert, sollte deshalb die Kosten pro Aufgabe messen, nicht den Token-Preis vergleichen.

Das Kontextfenster liegt bei 1.048.576 Token Input und 65.536 Token Output, der Knowledge Cutoff laut Model Card bei März 2026. Verarbeitet werden Text, Bild, Video, Audio und PDF; die Ausgabe ist ausschließlich Text (keine Live API). Das Reasoning lässt sich über die Thinking-Level low, medium (Default) und high steuern; minimal wird mit einem Fehler abgelehnt, thinking_budget ist durch thinking_level ersetzt. An Werkzeugen stehen Function Calling, Structured Output, Code Execution, File Search, URL Context, Google Search Grounding, Batch, Flex und Priority Inference sowie Computer Use (Preview) bereit. Das am 1. September 2026 vorgestellte Agentic Video Understanding nennt Google ausdrücklich nur für 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite – nicht für 3.8 Flash.

Preise (Gemini API): Bis zum 31. Dezember 2026 gilt derselbe Einführungspreis wie bei 3.7 und 3.6 Flash: $0,75 pro 1M Input-Token und $3,75 pro 1M Output-Token (inklusive Thinking-Token; Caching $0,075; Batch $0,375 / $1,875; Priority $1,35 / $6,75). Ab dem 1. Januar 2027 steigen die Listenpreise auf $1,50 / $7,50 / $0,15. Laut Google gilt der Einführungspreis sowohl in AI Studio als auch auf der Gemini Enterprise Agent Platform. Eine Kontextstaffelung gibt es nicht; Audio-Input wird nicht separat bepreist.

Migrationshinweis: Neben temperature, top_p und top_k ist auch candidate_count deprecated; FunctionResponse-Objekte benötigen call_id und name. Bestehende Integrationen auf 3.5 oder 3.6 Flash, die noch thinking_level: minimal senden, brechen beim Wechsel.

Gemini 3.7 Flash – Vorgängermodell (GA seit 13. August 2026)

Gemini 3.7 Flash (gemini-3.7-flash) ist seit dem 13. August 2026 direkt als GA verfügbar – ohne vorgelagerte Preview. Google positioniert das Modell für Coding, Web-Entwicklung, Wissensarbeit und agentische Workflows und betont, dass die Fortschritte nicht aus einem Neutraining stammen, sondern aus algorithmischen Verbesserungen und ausgewertetem Entwickler-Feedback.

Die von Google veröffentlichten Benchmark-Werte im Vergleich zu Gemini 3.6 Flash:

BenchmarkGemini 3.7 FlashGemini 3.6 Flash
DeepSWE v1.1 (autonomes Coding)65,3 %49,0 %
FrontierCode 1.1 Main43,6 %34,4 %
WebDev Arena (Elo)15881538
Terminal-bench 2.185,8 %
Harvey LAB-AA (Legal Reasoning)90,7 %
LVBench (Video-Verständnis)85,4 %

Das Kontextfenster liegt bei 1.048.576 Token Input und 65.536 Token Output. Verarbeitet werden Text, Bild, Video, Audio und PDF; das Reasoning lässt sich über die Thinking-Level low, medium und high steuern (ein „minimal"-Level gibt es nicht). An Werkzeugen stehen Function Calling, Structured Output, Code Execution, File Search, Google Search Grounding sowie Computer Use (Preview) bereit. Für Medienworkloads relevant: Seit dem 1. September 2026 ist Agentic Video Understanding für 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite GA – ohne Aufpreis, laut Google mit bis zu 88 % weniger Token, bis zu 66 % geringeren Kosten und bis zu 7 % besserer Genauigkeit auf LongVideoBench.

Preise (Gemini API): Bis zum 31. Dezember 2026 gilt ein Einführungspreis von $0,75 pro 1M Input-Token und $3,75 pro 1M Output-Token (Caching $0,075). Ab dem 1. Januar 2027 steigen die Listenpreise auf $1,50 / $7,50 / $0,15 – wer jetzt kalkuliert, sollte diese Verdopplung in der Wirtschaftlichkeitsrechnung berücksichtigen. Ein limitierter Free Tier ist verfügbar.

Der Knowledge Cutoff liegt laut Model Card bei März 2026. Seit dem 2. September 2026 führt Google 3.7 Flash als Vorgängergeneration; für Neuprojekte ohne Residenzpflicht ist 3.8 Flash die aktuelle Wahl. Migrationshinweis: Die Sampling-Parameter temperature, top_p und top_k sind seit dem 21. Juli 2026 deprecated und gelten auch für 3.7 Flash – bestehende Integrationen sollten geprüft werden.

Gemini 3.6 Flash – Workhorse der Vorgängerstufe (GA seit 21. Juli 2026)

Gemini 3.6 Flash (gemini-3.6-flash) verbessert Coding, Knowledge Work und multimodale Verarbeitung gegenüber 3.5 Flash. Auf dem Coding-Benchmark DeepSWE springt das Modell von 37 auf 49 Prozent, bei OSWorld-Verified (Computer Use) erreicht es 83 Prozent. Gleichzeitig produziert es 17 Prozent weniger Output-Token als 3.5 Flash – Google adressiert damit direkt das Entwickler-Feedback zur Verbosity, was die effektiven Kosten pro Aufgabe zusätzlich senkt. Der Knowledge Cutoff liegt bei März 2026, das Kontextfenster bei 1 Million Token Input (65.536 Output).

Preiskorrektur gegenüber unserem Stand vom 24. Juli: Zum Launch kostete 3.6 Flash $1,50/1M Input und $7,50/1M Output. Inzwischen liegt es – wie 3.7 Flash – beim Einführungspreis von $0,75/1M Input und $3,75/1M Output, befristet bis zum 31. Dezember 2026. Verfügbar ist das Modell über die Gemini API (AI Studio, Android Studio), Antigravity, die Gemini Enterprise Agent Platform und die Gemini App.

Gemini 3.5 Flash-Lite – Speed für Hochvolumen-Workloads (GA seit 21. Juli 2026)

Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) ist das schnellste Modell der 3.5-Serie: 350 Output-Tokens pro Sekunde laut Messung von Artificial Analysis, zu Preisen von $0,30/1M Input und $2,50/1M Output. Damit eignet es sich für Hochvolumen-Automatisierung, Klassifikation und latenzkritische Anwendungen – etwa als Sub-Agent in Multi-Agent-Pipelines. Google rollt das Modell zusätzlich in der Google-Suche aus.

Gemini 3.8 Flash Cyber und das Fairwind Program – Security-Modelle mit beschränktem Zugang

Mit Gemini 3.5 Flash Cyber hatte Google am 21. Juli 2026 erstmals ein dediziertes Cybersecurity-Modell angekündigt, gekoppelt an den CodeMender-Security-Agenten und exklusiv für Regierungen und geprüfte Partner. Am 2. September 2026 folgte der Nachfolger Gemini 3.8 Flash Cyber, der ausschließlich über das neue Fairwind Program bereitgestellt wird – für Regierungen, Betreiber kritischer Infrastruktur und Kern-Technologieplattformen, laut Google mit über 650 Partnern zum Start. Google nennt für 3.8 Flash Cyber unter anderem 86,2 % Pass@1 auf CyberGym (3.5 Flash Cyber: 77,5 %), 71,0 % auf einem internen Schwachstellen-Benchmark über 20 Programmiersprachen (3.7 Flash: 58,9 %) und 47,2 % Pass@1 auf CWE-Bench. Für Unternehmen außerhalb des Programms ist das Modell damit nicht verfügbar, zeigt aber Googles Kurs, sicherheitskritische Fähigkeiten kontrolliert auszurollen – ein Muster, das wir bereits von den Freigabeprozessen bei OpenAI GPT-5.6 und Anthropic Claude Mythos 5.1 kennen.

Gemini 3.5 Flash – Agentic-first

Mit Gemini 3.5 Flash positioniert Google sein schnellstes Modell erstmals oberhalb des eigenen Pro-Flagships: 3.5 Flash übertrifft Gemini 3.1 Pro auf Terminal-Bench 2.1 (Coding), GDPval-AA Elo (Real-World Agentic) und MCP Atlas (Tool Use). Das Modell ist auf mehrstündige autonome Workflows ausgelegt – etwa Coding-Pipelines, Research-Projekte oder den Aufbau ganzer Systeme. Es pausiert an Entscheidungspunkten und holt menschlichen Input ein. Eine kommende Variante soll bis zu 12× schneller als andere Frontier-Modelle bei gleichbleibender Qualität liefern.

Gemini 3.5 Pro – Orchestrator (weiter verschoben)

Gemini 3.5 Pro bleibt auch Anfang September 2026 in Partner-Tests, ohne neuen Termin; der Launch-Blog zu 3.8 Flash erwähnt es nicht. Die Chronologie: angekündigt auf der Google I/O am 19. Mai 2026, das Ziel Juni verfehlt, ein berichtetes Ziel zum 17. Juli ebenfalls verfehlt – am 21. Juli veröffentlichte Google stattdessen drei kleinere Modelle, am 13. August und 2. September zwei weitere Flash-Generationen. Medienberichte (Bloomberg, Axios, Forbes, 9to5google, jeweils 13. August 2026) führen die Verzögerung darauf zurück, dass die Coding-Performance interne Zielwerte nicht erreicht; eine Bestätigung durch Google gibt es dafür nicht.

Konzipiert ist das Modell als Orchestrator/Planner, der Gemini 3.5/3.6/3.7 Flash als Sub-Agenten dirigiert. Angekündigt sind 2M Token Kontextfenster sowie ein Deep-Think-Reasoning-Modus. Praktisch heißt das für Anwender: Das Pro-Flaggschiff ist weiterhin Gemini 3.1 Pro (gemini-3.1-pro-preview, Preview seit 19. Februar 2026, $2/1M Input und $12/1M Output bei bis zu 200k Kontext). Ein Gemini 3.5, 3.6, 3.7 oder 3.8 Pro existiert nicht – die 3.5- bis 3.8-Generationen sind reine Flash-Linien.

Gemini Spark – agentischer 24/7-Assistent

Mit Gemini Spark hat Google auf der I/O 2026 einen agentischen Personal-Assistant vorgestellt; inzwischen basiert er auf Gemini 3.7 Flash. Spark läuft kontinuierlich in Googles Cloud, lässt sich per dedizierter Gmail-Adresse direkt anschreiben und führt Aufgaben über Chrome und Google Workspace im Hintergrund aus. Spark unterstützt das Model Context Protocol (MCP) für die Anbindung externer Dienste.

Für Kunden im DACH-Raum relevant: Google gibt die Verfügbarkeit von Spark mit über 160 Ländern an, nimmt davon aber den EWR, die Schweiz, das Vereinigte Königreich und Nigeria ausdrücklich aus. Das betrifft das Endnutzerprodukt, nicht die API – Gemini 3.7 Flash selbst ist über die Gemini API und die Gemini Enterprise Agent Platform auch aus der EU nutzbar.

Sehr großes Kontextfenster

Gemini 3.1 Pro verarbeitet bis zu 2 Millionen Tokens in einem einzigen Kontext. Damit lassen sich umfangreiche Vertragswerke, technische Dokumentationen oder ganze Codebases in einer Anfrage analysieren. Die Flash-Modelle bieten ein Kontextfenster von 1.048.576 Tokens bei deutlich geringeren Kosten.

Multimodale Verarbeitung

Die Gemini-3.x-Familie verarbeitet Text, Bilder, Audio, Video und PDF-Dokumente nativ. Das ermöglicht Anwendungsfälle wie automatisierte Videoanalyse, Dokumentenextraktion aus gescannten PDFs oder die Auswertung von Meetings mit Audio- und Bildmaterial.

Google-Ökosystem

  • Gemini Enterprise Agent Platform (vormals Vertex AI): Enterprise-Deployment mit SLA und Data-Residency-Optionen
  • Antigravity: Agentische Entwicklungsplattform für die aktuellen Flash-Modelle
  • Gemini Enterprise: Enterprise-Frontend mit Zugriff auf 3.8, 3.7, 3.6 und 3.5 Flash
  • Google Workspace: Integration in Docs, Sheets, Gmail und weitere Produkte
  • Search Grounding: Zugriff auf aktuelle Webinformationen
  • Google AI Studio: Schneller Einstieg und Prototyping

Spezialisierte Varianten

  • Gemini 3.1 Flash Thinking: Erweitertes Reasoning für komplexe STEM-Aufgaben mit transparentem Denkprozess
  • Gemini 3.1 Pro Deep Research: Spezialisiert auf mehrstufige Recherchen und lange Analyseaufgaben

Die Modellfamilie im September 2026

Die Gemini-Familie ist inzwischen breit gefächert. Für die Auswahl hilft eine Sortierung nach Reifegrad:

Generell verfügbar (GA), mit Listenpreisen pro 1M Token:

ModellInputOutput
Gemini 3.8 Flash$0,75 (bis 31.12.2026, danach $1,50)$3,75 (danach $7,50)
Gemini 3.7 Flash$0,75 (bis 31.12.2026, danach $1,50)$3,75 (danach $7,50)
Gemini 3.6 Flash$0,75 (bis 31.12.2026, danach $1,50)$3,75 (danach $7,50)
Gemini 3.5 Flash$1,50$9,00
Gemini 3.5 Flash-Lite$0,30$2,50
Gemini 3.1 Flash-Lite$0,25$1,50

Die Gemini-2.5-Reihe (Pro, Flash, Flash-Lite) läuft als Legacy-Generation weiter und ist für EU-Projekte weiterhin relevant, weil sie vollständige Data Residency unterstützt.

Neu seit Ende August 2026: Gemini Omni 1.1 Flash (gemini-omni-1.1-flash, GA seit 27. August 2026) erweitert die Videogenerierung um Scene Extension in 10-Sekunden-Schritten bis 40 Sekunden, First/Last-Frame-Interpolation, einen 360p-Draft-Modus sowie 1080p/4K-Upscaling; abgerechnet wird über Output-Token (5.792 Token pro Sekunde 720p-Video). Die Preview gemini-omni-flash-preview wird am 30. September 2026 abgeschaltet. Gemini 3.5 Transcribe (gemini-3.5-transcribe, Diarisierung, Word-Timestamps, Vokabular-Bias) und Gemini 3.5 Transcribe Live (WebSocket-Streaming) sind seit dem 26. August 2026 verfügbar – der Gemini-API-Changelog spricht von GA, Googles Blog von Public Preview.

In Preview: Gemini 3.1 Pro (das Pro-Flaggschiff), Gemini 3 Flash, Gemini 3.5 Live Translate (über 70 Sprachen), Gemini 3.1 Flash Live, Gemini 3.1 Flash TTS, Deep Research und Deep Research Max, der Antigravity Agent, Gemini Embedding 2 sowie Gemini Robotics ER 2.

Bildmodelle: Nano Banana 2 (gemini-3.1-flash-image), Nano Banana 2 Lite und Nano Banana Pro (gemini-3-pro-image, bis 4K).

Deep Think: Nach uns vorliegenden Sekundärquellen existiert derzeit nur Gemini 3.1 Deep Think, mit Consumer-Zugang über AI Ultra. Ein 3.5 Deep Think gibt es nicht, weil das zugrunde liegende 3.5-Pro-Basismodell fehlt. Eine Gemini-3.x-Nano-Reihe ist uns nicht belegbar bekannt.

Data Residency: DRZ und MLP auseinanderhalten

Der wichtigste Punkt für DSGVO-Projekte mit Gemini ist eine Unterscheidung, die in Googles Dokumentation konsequent durchgehalten wird, in Marketingmaterial aber oft verschwimmt:

  • DRZ – Data Residency at Rest: Gespeicherte Daten bleiben in der gewählten Region.
  • MLP – Machine Learning Processing: Auch die Verarbeitung durch das Modell findet in der gewählten Region statt.

Erst beides zusammen ergibt eine vollständige EU-Lokalisierung. Ein Modell, für das nur DRZ zugesagt ist, verarbeitet Prompts unter Umständen außerhalb der EU. Genau an dieser Stelle unterscheiden sich die Gemini-Modelle deutlich. Der folgende Stand entstammt Googles Locations-Dokumentation:

ModellUS-/EU-Multi-RegionIn-Country
Gemini 3.7 Flash„Only available in the global region"nein
Gemini 3.6 Flashus: DRZ + MLP mit Allowlist · eu: „Only available in the global region"nein
Gemini 3.5 FlashDRZ und MLP unterstütztIndien, Japan, Singapur, UK; Kanada nein
Gemini 2.5 ProDRZ und MLP unterstütztKanada, Japan

Regionenmodell

Google unterscheidet drei Multi-Regionen: global ist der Default und bietet die beste Performance sowie die neuesten Features – aber keine Residenz-Garantie. Daneben stehen us und eu. Der EU-Multi-Region-Endpoint lautet https://aiplatform.eu.rep.googleapis.com. Zusätzlich gibt es In-Country-Regionen (GA, jeweils mit Allowlist): ca, in, asia-northeast1 (Japan), sg und europe-west2 (UK).

Zero Data Retention

Bei der Gemini API / AI Studio ist ZDR nur für „Paid Services" verfügbar – im Free Tier gibt es kein ZDR. Bei genehmigtem ZDR entfernt Google Prompts, Responses und identifizierende Metadaten vor dem Logging. Auch mit ZDR nicht abschaltbar sind allerdings: Google Search Grounding (30 Tage Speicherung) und Google Maps Grounding (30 Tage). Weitere Speicherung greift standardmäßig bei der Interactions API (Konversationsstatus; erfordert store: false), der Live API (Session-State bis 24 Stunden) und der File API (bis zur Löschung durch den Nutzer).

Auf der Gemini Enterprise Agent Platform ist ZDR laut Anbieter-Dokumentation und Praxisberichten erreichbar, erfordert aber aktive Schritte: Data Caching für Google-Modelle muss deaktiviert und das Abuse-Monitoring-Logging abgeschaltet werden – letzteres per Opt-out über Invoiced Billing oder als Ausnahme über einen Antrag beim Google-Support. Für einige „Advanced AI Features" ist ZDR nach diesen Quellen nicht möglich. Wir behandeln diese Angaben als sekundärbelegt und prüfen sie im Projekt jeweils vertraglich nach.

Die Gemini API ist nicht die Enterprise-Plattform

Die Gemini API / AI Studio ist in über 190 Ländern und damit in der gesamten EU verfügbar, enthält aber keine EU-Data-Residency- und keine DSGVO-spezifischen Zusagen. Google verweist für Compliance-Zusagen ausdrücklich auf die Gemini Enterprise Agent Platform. Für produktive Verarbeitung personenbezogener Daten ist der direkte Weg über AI Studio deshalb in aller Regel nicht der richtige.

Struktureller Verzug bei EU-Regionen

Neue Gemini-Modelle erscheinen zuerst global beziehungsweise in den US-Regionen und erreichen EU-Regionen mit erheblichem Verzug – oder, wie im Fall von 3.6, 3.7 und 3.8 Flash, gar nicht mit vollem MLP. Das ist kein Einzelfall, sondern ein wiederkehrendes Muster, das Entwickler auch in Googles eigenem Developer-Forum dokumentieren. Für die Architekturplanung heißt das: Wer EU-Datenresidenz benötigt, sollte nicht damit rechnen, jeweils das neueste Modell einsetzen zu können, und die Modellauswahl über Konfiguration statt über harte Verdrahtung im Code steuern.

Modell-Lebenszyklus und Deprecations

Google zieht Endpoints in erkennbarem Takt zurück. Für Betreiber produktiver Deployments gehört der Blick auf den Lebenszyklus deshalb in die Betriebsroutine.

Bereits abgeschaltet:

  • gemini-2.0-flash und gemini-2.0-flash-lite – 1. Juni 2026

  • gemini-3-pro-preview – 9. März 2026

  • gemini-3.1-flash-image-preview und gemini-3-pro-image-preview – 25. Juni 2026

  • Veo-2.0- und Veo-3.0-Endpoints – 30. Juni 2026

  • imagen-4.0-generate-001 samt Ultra- und Fast-Varianten sowie Gemini 3 Image – 17. August 2026

  • Grok-4.1-Modelle auf der Agent Platform – 20. August 2026

  • gemini-robotics-er-1.6-preview – 31. August 2026 (Nachfolger gemini-robotics-er-2-preview)

Anstehend:

  • gemini-omni-flash-preview30. September 2026 (Nachfolger gemini-omni-1.1-flash)
  • gemini-2.5-flash-image2. Oktober 2026
  • Deprecated Open-Model-Endpoints – 21. Oktober 2026
  • gemini-3.1-flash-lite – deprecated seit 7. Mai 2026, Shutdown 7. Mai 2027 (Nachfolger gemini-3.5-flash-lite)
  • Gemini 2.5 Pro / Flash / Flash-Lite: In der Gemini API deprecated, aber ohne Shutdown-Datum. Für die Agent Platform kursiert nach Sekundärquellen ein Retirement im Oktober 2026; Googles Lifecycle-Seite konnten wir nicht direkt verifizieren. Wer 2.5 Pro als EU-Legacy-Option nutzt, sollte die Migration jetzt planen.
  • Gemini 3.5 Flash: In der Gemini API seit dem 19. Mai 2026 als deprecated gelistet – ohne Shutdown-Datum, Status weiterhin „Stable".

Parameter-Deprecation: Seit dem 21. Juli 2026 sind die Sampling-Parameter temperature, top_p und top_k deprecated (bei 3.8 Flash zusätzlich candidate_count). Das gilt auch für Gemini 3.7 und 3.8 Flash. Ältere Integrationen, die diese Parameter fest verdrahtet haben, sind beim Modellwechsel ein häufiger Stolperstein – wir empfehlen, Modell-IDs und Request-Parameter zentral zu konfigurieren statt sie im Anwendungscode zu verteilen.

Verfügbarkeit in der EU

Stand 3. September 2026: Gemini 3.5 Flash ist das neueste Gemini-Modell, für das Google sowohl Data Residency at Rest als auch Machine Learning Processing in der EU-Multi-Region dokumentiert (seit dem 31. August 2026 zusätzlich In-Country in Kanada). Anfragen werden innerhalb der EU-Geografie geroutet und sind über das Data Processing Addendum DSGVO-abgedeckt. Gemini 3.8 Flash, 3.7 Flash und 3.6 Flash lassen sich in EU-Deployments zwar auswählen, laufen dabei aber über die globale Region – ohne Residenzzusage. Gemini 3.5 Pro bleibt in Partner-Tests ohne Termin. Neu: Gemini 3.1 Flash Image (Nano Banana 2) ist seit dem 31. August 2026 GA in den Multi-Regionen us und eu.

Was in der EU heute geht

  • Gemini 3.5 Flash über den EU-Multi-Region-Endpoint — mit DRZ und MLP in der EU, GA auf der Gemini Enterprise Agent Platform. Unsere Empfehlung für residenzpflichtige Workloads.
  • Gemini 2.5 Pro — Legacy-Generation, ebenfalls mit DRZ und MLP in der EU-Multi-Region; Retirement auf der Agent Platform nach Sekundärquellen im Oktober 2026 (siehe Lebenszyklus).
  • Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite über die globale Region — für Workloads ohne Residenzpflicht. In einem EU-Deployment sind die Modelle auswählbar; Administratoren bestätigen dabei laut Google-Doku eine Warnung, dass der Traffic an den globalen Endpoint geht.

Was noch fehlt

  • EU-Machine-Learning-Processing für Gemini 3.8 Flash, 3.7 Flash und 3.6 Flash — laut Locations-Dokumentation (Stand 2. September 2026) nur globale Region, obwohl die Release Notes alle drei Modelle als GA in us und eu führen
  • Single-Region-Endpoints (europe-west1/3/4) für Gemini 3.8 Flash — von Google nicht dokumentiert
  • Dokumentierte EU-Data-Residency für Gemini 3.5 Flash-Lite
  • In-Country-Regionen in der EU — für die relevanten Gemini-Modelle listet Google In-Country-Residenz nur außerhalb der EU (Kanada, Indien, Japan, Singapur, UK), nicht in europe-west3 oder europe-west4
  • Gemini 3.5 Pro (Partner-Tests, Termin offen) — EU-Verfügbarkeit wird zum GA-Launch bewertet

Wir empfehlen, Googles Locations- und Data-Residency-Dokumentation und die Gemini-Enterprise-Release-Notes regelmäßig zu prüfen — und im Zweifel der Locations-Dokumentation zu folgen, weil sie die Residenz-Zusagen führt.

Einordnung zum EU AI Act

Ergänzend gilt seit dem 2. August 2026 die Durchsetzung der Transparenzpflichten des EU AI Act, mit Bußgeldern von bis zu 3 Prozent des weltweiten Jahresumsatzes. Google hat nach vorliegenden Sekundärquellen den EU AI Act Transparency Code of Practice unterzeichnet und kennzeichnet generierte Inhalte über SynthID-Wasserzeichen. Für die Modellauswahl ist das ein zusätzlicher Prüfpunkt, ersetzt aber die Residenz-Betrachtung nicht.

Integration mit CompanyGPT

Gemini-Modelle sind in CompanyGPT integriert. Gemini 3.5 Flash ist über den EU-Multi-Region-Endpoint für DSGVO-konforme Reasoning- und Agentic-Coding-Workloads angebunden — mit Data Residency at Rest und Machine Learning Processing in der EU. Gemini 2.5 Pro steht als Legacy-Option mit denselben Residenz-Eigenschaften zur Verfügung. Sobald Google EU-MLP für ein neueres Gemini-Modell dokumentiert, ergänzen wir es als Default-Option.

Unsere Empfehlung

Seit dem 2. September 2026 ist Gemini 3.8 Flash das leistungsfähigste GA-Modell von Google. Für die Modellauswahl in EU-Projekten ist aber nicht die Benchmark-Tabelle ausschlaggebend, sondern die Frage, ob der Workload EU-Datenresidenz benötigt:

  • Mit EU-Residenzpflicht (personenbezogene Daten, regulierte Branchen): Gemini 3.5 Flash über den EU-Multi-Region-Endpoint. Es ist das neueste Gemini-Modell mit DRZ und MLP in der EU und bleibt damit unsere EU-Empfehlung – auch wenn Google es inzwischen als Legacy-Flash-Modell bezeichnet (ohne Shutdown-Datum).
  • Ohne Residenzpflicht, mit Fokus auf Coding und agentische Workflows: Gemini 3.8 Flash über die globale Region — laut Google deutliche Benchmark-Zuwächse gegenüber 3.7 Flash beim Einführungspreis von $0,75/1M Input. Zwei Punkte in der Kalkulation berücksichtigen: den rund 30 % höheren Token-Verbrauch pro Aufgabe (Messung Artificial Analysis) und die Preisverdopplung ab 01.01.2027. Gemini 3.7 Flash bleibt eine Option, wenn der Token-Verbrauch pro Task wichtiger ist als die letzten Benchmark-Punkte.
  • Hochvolumen und latenzkritisch: Gemini 3.5 Flash-Lite ($0,30/1M Input, 350 Tokens/s) oder Gemini 3.1 Flash-Lite ($0,25/1M Input) über die globale Region.
  • Legacy-Bestand mit EU-Residenz: Gemini 2.5 Pro — technisch überholt, aber mit vollständiger EU-Data-Residency.
  • Cross-Cloud-Alternative: Anthropic Claude Opus 5 oder Claude Sonnet 5 (Modellseite) über AWS Bedrock (in-region Irland/Stockholm, Frankfurt über EU-Geo-Inferenz) — sinnvoll für Multi-Cloud-Strategien oder wenn der Workload nicht an Google Cloud gebunden ist. Das am 1. September 2026 veröffentlichte Claude Fable 5.1 läuft mit EU-Datenresidenz über die Europe-Multi-Region der Agent Platform (auf Bedrock nur global), unterliegt aber als Covered Model der 30-Tage-Speicherpflicht.

Sie sind unsicher, welche Variante zu Ihrer Datenschutz-Folgenabschätzung passt? Wir prüfen die Residenz- und Vertragslage im konkreten Projekt und beobachten das EU-Rollout der Gemini-Modelle laufend — diese Seite aktualisieren wir, sobald Google EU-MLP für ein neueres Modell dokumentiert.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Häufig gestellte Fragen

Was kostet Gemini 3.8 Flash?

Gemini 3.8 Flash (gemini-3.8-flash, GA seit 2. September 2026) kostet in der Gemini API bis zum 31. Dezember 2026 einführungsweise 0,75 USD pro 1 Million Input-Token und 3,75 USD pro 1 Million Output-Token inklusive Thinking-Token; Context Caching 0,075 USD, Batch 0,375 / 1,875 USD. Ab dem 1. Januar 2027 gelten 1,50 / 7,50 USD. Laut Google gilt der Einführungspreis auch auf der Gemini Enterprise Agent Platform.

Ist Gemini 3.8 Flash mit EU-Datenresidenz nutzbar?

Nein, Stand 3. September 2026. Die Gemini-Enterprise-Release-Notes melden 3.8 Flash zwar als GA in global, us und eu, Googles Locations- und Data-Residency-Dokumentation führt das Modell aber wie 3.7 und 3.6 Flash als „Only available in the global region“ ohne Data Residency at Rest und ohne ML-Processing in der EU. Das neueste Gemini-Modell mit dokumentierter EU-Datenresidenz (DRZ und MLP) bleibt Gemini 3.5 Flash.

Was ist neu an Gemini 3.8 Flash gegenüber 3.7 Flash?

Laut Googles Evaluation steigt DeepSWE v1.1 von 65,3 auf 73,7 Prozent, Terminal-bench 2.1 von 85,8 auf 89,4 Prozent und HLE-Verified von 53,6 auf 54,9 Prozent. Kontextfenster (1.048.576 Input, 65.536 Output) und Listenpreis bleiben gleich. Das Modell arbeitet laut Google „härter“ und verbraucht mehr Token; Artificial Analysis misst rund 30 Prozent mehr Output-Token pro Aufgabe, also höhere Kosten pro Task.

Gibt es Gemini 3.8 Pro oder Gemini 3.5 Pro?

Nein. Die Generationen 3.5 bis 3.8 sind reine Flash-Linien. Gemini 3.5 Pro wurde am 19. Mai 2026 angekündigt und befindet sich Anfang September 2026 weiterhin in Partner-Tests ohne Termin. Das Pro-Flaggschiff bleibt Gemini 3.1 Pro (gemini-3.1-pro-preview, 2 / 12 USD pro 1M Token bis 200k Kontext).

Welches Gemini-Modell empfehlen wir für DSGVO-pflichtige Workloads?

Gemini 3.5 Flash über den EU-Multi-Region-Endpoint der Gemini Enterprise Agent Platform: das neueste Gemini-Modell, für das Google Data Residency at Rest und ML-Processing in der EU dokumentiert (1,50 / 9,00 USD pro 1M Token). Gemini 2.5 Pro bleibt eine Legacy-Option mit EU-Residenz. Gemini 3.8, 3.7 und 3.6 Flash eignen sich für Workloads ohne Residenzpflicht über die globale Region.

Was ist Gemini 3.8 Flash Cyber?

Ein am 2. September 2026 angekündigtes Cybersecurity-Modell, das ausschließlich über Googles Fairwind Program für Regierungen, Betreiber kritischer Infrastruktur und Kern-Technologieplattformen bereitgestellt wird (laut Google über 650 Partner zum Start). Google nennt unter anderem 86,2 Prozent Pass@1 auf CyberGym. Für Unternehmen außerhalb des Programms ist das Modell nicht verfügbar.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.