Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM Microsoft USA

Microsoft Phi & MAI

Microsoft MAI-Familie und Phi: MAI-Transcribe-2 (neu am 3. September 2026, 60 Sprachen, 0,10 USD pro Stunde, EU-Region North Europe), MAI-Thinking-1, MAI-Code-1-Flash, MAI-Voice-2 mit deutschen Stimmen, MAI-Image-2.5 sowie Phi-4-reasoning-vision und Phi-4 für Edge und lokale Deployments. DSGVO-Einordnung je Modell (Foundry-Regionen, Global Standard vs. Regional). Stand: 3. September 2026. KI-Beratung Rosenheim.

Lizenz MIT
DSGVO-Hosting Verfügbar
Kontext 256k (MAI-Thinking-1), 16k (Phi-4), bis 128k (Phi-3 Varianten) Tokens
Modalität Text, Image, Audio → Text, Image, Audio

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
MAI-Transcribe-2 Empfohlen
3. September 2026 (Public Preview)
60 Sprachen inklusive Deutsch (MAI-Transcribe-1.5: 43), Standard ist der mehrsprachige Modus mit automatischer Spracherkennung FLEURS-Benchmark: laut Microsoft Platz 1 über 60 Sprachen bei durchschnittlich 5,2 % Wortfehlerrate; Platz 2 auf dem Artificial-Analysis-WER-Leaderboard Laut Microsoft bis zu 10× schneller als OpenAI GPT-Transcribe, 7× schneller als ElevenLabs Scribe v2 und 5× schneller als Gemini 3.5 Transcribe Speaker-Diarisierung, Word-Level-Timestamps, Keyword-Biasing (phraseList), Code-Switching (z. B. Hinglish, Spanglish), Rauschrobustheit Transkriptionsstil wählbar: verbatim (mit Füllwörtern, für Compliance und QA) oder clean (für Protokolle und Untertitel) Auch als Eingabe-Transkription in der Voice Live API nutzbar
Public Preview ohne SLA – laut Microsoft nicht für Produktiv-Workloads empfohlen In der EU nur North Europe; kein Germany West Central, West Europe oder Sweden Central für dieses Modell Nur Datei-Transkription bis 300 MB (WAV, MP3, FLAC) über die REST-API; Parameter derzeit nur im REST-Pfad dokumentiert Einführungspreis befristet bis Ende 2026
Preview
MAI-Transcribe-1.5
2. Juni 2026 (Build 2026)
43 Sprachen inklusive Deutsch, laut Microsoft Platz 1 auf FLEURS zum Launch Content-Biasing und verbesserte Genauigkeit gegenüber MAI-Transcribe-1
Von MAI-Transcribe-2 (3. September 2026) abgelöst: weniger Sprachen, höherer Preis MAI-Transcribe-1 ist seit dem 20. August 2026 deprecated
Aktuell
MAI-Voice-2 / MAI-Voice-2-Flash
2. Juni 2026 (Build 2026, Public Preview)
15 Sprachen und 18 Locales, darunter Deutsch mit den Stimmen de-DE-Klaus und de-DE-Mia Feinsteuerung von Emotionen und Stilen per SSML (mstts:express-as), z. B. happy, empathy, whispering MAI-Voice-2-Flash für latenzkritische Voice-Agents, IVR und Call-Center; MAI-Voice-2 für Long-Form-Inhalte mit Sprecherkonsistenz Instant Voice Cloning aus 5 bis 60 Sekunden Referenzaudio – nur nach Limited-Access-Freigabe und mit Einwilligung
Public Preview ohne SLA Kein Germany West Central – EU-Betrieb über West Europe, Sweden Central oder France Central Voice Cloning gated (Custom Neural Voice Limited Access)
Preview
MAI-Image-2.5 / Flash / Pro
2. Juni 2026 (Pro: 19. Juni 2026), Preview
Text-to-Image und Image-to-Image mit präzisen, lokalen Bearbeitungen (laut Microsoft „control with preservation“) Laut Microsoft Platz 2 auf Arena.ai bei Bildbearbeitung (Build 2026) Flash-Variante für Geschwindigkeit, Pro-Variante für fotorealistische Ausgabe; in PowerPoint und OneDrive integriert Bis 1.048.576 Pixel Gesamtfläche (z. B. 1024×1024 oder 768×1365), PNG-Ausgabe
Preview; Prompts derzeit nur Englisch (Languages: en) Nur Global Standard – keine EU-Data-Zone-Zusage
Preview
MAI-Thinking-1 Empfohlen
2. Juni 2026 (Public Preview)
Erstes vollständig hauseigenes Microsoft-Reasoning-Modell (ohne OpenAI-Distillation) Sparse Mixture-of-Experts mit 35B aktiven Parametern 256k Kontextfenster 97,0 % AIME 2025, 94,5 % AIME 2026 Auf SWE-Bench Pro auf Augenhöhe mit Claude Opus 4.6 Auf kommerziell lizenzierten Daten trainiert OpenAI-kompatible Chat-Completions-API (Endpoint /mai/v1), Function Calling, verschlüsselte Chain-of-Thought zur Weitergabe über Turns
Public Preview ohne SLA – noch wenig Praxiserfahrung im Enterprise-Einsatz Nur Global Standard (kein PTU, keine EU Data Zone); Output auf 64k Token begrenzt Nicht Open Source
Preview
MAI-Code-1-Flash Empfohlen
2. Juni 2026
5B Parameter Coding-Modell – schnell und günstig Schlägt Claude Haiku 4.5 auf allen vier getesteten Coding-Benchmarks 16 Punkte Vorsprung auf SWE-Bench Pro (51,2 % vs. 35,2 %) Direkt in GitHub Copilot (Free, Pro, Pro+, Max) integriert
Spezialisiert auf Coding – kein Allzweck-Modell Nicht Open Source
Aktuell
Phi-4-reasoning-vision-15B Empfohlen
4. März 2026
15B Parameter mit Vision und Reasoning Entscheidet selbst, wann tiefes Reasoning nötig ist 84,8 AI2D, 83,3 ChartQA, 75,2 MathVista, 88,2 ScreenSpot v2 MIT-Lizenz, auf Microsoft Foundry, HuggingFace und GitHub
Höherer Ressourcenbedarf als Phi-4 16k Kontextfenster
Aktuell
Phi-4-reasoning (14B)
April 2025
Reines Reasoning-Modell (kein Vision) MIT-Lizenz
Kein Vision-Support
Aktuell
Phi-4-mini
Februar 2025
3.8B Parameter – Edge-fähig MIT-Lizenz
Geringere Kapazität
Aktuell
Phi-4-multimodal
Februar 2025
Multimodale Eingaben (Text, Bild, Audio) MIT-Lizenz
Aktuell
Phi-4
Dezember 2024
14B Parameter - sehr effizient Starke Reasoning-Fähigkeiten
Kleiner als Frontier-Modelle
Aktuell
Phi-3.5-MoE
2024
Mixture-of-Experts 42B Parameter (6.6B aktiv)
Aktuell
Phi-3.5-mini
2024
3.8B Parameter Laeuft auf Smartphones
Begrenzte Kapazität
Aktuell
Phi-3.5-vision
2024
Multimodal Bildverständnis
Aktuell
Phi-3-medium
2024
14B Parameter Balance aus Größe und Leistung
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Edge AI & IoT
Mobile Anwendungen
Offline-Szenarien
Embedded Systems
Ressourcenbeschränkte Umgebungen
Coding-Assistenten
Lokale LLM-Deployments

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public
Latenz (TTFT) ~100ms (lokal)
Durchsatz Hardwareabhängig Tokens/Sek
Features & Capabilities
Tool Use Function Calling Structured Output Vision Reasoning Mode Datei-Upload
Training & Wissen
Wissensstand Februar 2026 (Phi-4-reasoning-vision), 2024-10 (Phi-4)
Fine-Tuning Verfügbar (LoRA, QLoRA, Full Fine-Tuning)
Sprachunterstützung
Beste Qualität Englisch, Deutsch
Unterstützt 20+ Sprachen
Optimiert für Englisch, brauchbare Qualität in Deutsch

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene Infrastruktur
Empfohlen - volle Datenkontrolle
Azure
West Europe / Germany
Azure AI Model Catalog
Ollama
Lokal
Einfaches lokales Deployment
Lizenz & Hosting
Lizenz MIT
Sicherheitsfilter Anpassbar
Enterprise Support Ja
SLA verfügbar Ja
On-Premise Edge-fähig

Benchmarks

Leistungsvergleich mit standardisierten Tests

MMLU
84.8%
HumanEval
82.6%
GSM8K
91.1%
MATH
55.5%

Als KI-Beratung aus Rosenheim empfehlen wir Microsoft Phi für Unternehmen im DACH-Raum, die leistungsstarke KI auf ressourcenbeschränkter Hardware betreiben möchten. Seit der Veröffentlichung von Phi-4 im Dezember 2024 haben sich die Phi-Modelle als zuverlässige Lösung für Edge- und On-Premise-Deployments etabliert und bieten beeindruckende Leistung bei minimalen Anforderungen. Mit der MAI-Familie (Build 2026) erweitert Microsoft das eigene Modell-Portfolio nun um vollständig hauseigene Reasoning- und Coding-Modelle.

Neu: MAI-Transcribe-2 – Speech-to-Text in 60 Sprachen (3. September 2026)

Am 3. September 2026 hat Microsoft AI MAI-Transcribe-2 vorgestellt und als Public Preview in Microsoft Foundry, im MAI Playground und über OpenRouter bereitgestellt. Das Modell transkribiert 60 Sprachen – darunter Deutsch – und erreicht laut Microsoft auf dem FLEURS-Benchmark Platz 1 bei durchschnittlich 5,2 % Wortfehlerrate; auf dem unabhängigen Artificial-Analysis-WER-Leaderboard liegt es nach Microsoft-Angaben auf Platz 2. Bei der Geschwindigkeit nennt Microsoft bis zu 10× schneller als OpenAI GPT-Transcribe, 7× schneller als ElevenLabs Scribe v2 und 5× schneller als Gemini 3.5 Transcribe. Der Preis liegt bei 0,10 USD pro Stunde Audio als befristetes Angebot bis Ende 2026 (MAI-Transcribe-1: 0,36 USD pro Stunde) – Diarisierung, Word-Timestamps und Keyword-Biasing sind darin enthalten.

Funktionen: Speaker-Diarisierung, Word-Level-Timestamps, Keyword-Biasing über eine Phrasenliste, automatische Spracherkennung, Code-Switching innerhalb einer Äußerung, Rauschrobustheit und wählbarer Transkriptionsstil (verbatim mit Füllwörtern für Compliance und QA, clean für Protokolle und Untertitel). Aufgerufen wird das Modell über die Fast-Transcription-API von Azure Speech (enhancedMode.model = "MAI-Transcribe-2", Dateien bis 300 MB in WAV, MP3 oder FLAC) oder als Eingabe-Transkription in der Voice Live API. MAI-Transcribe-1.5 (43 Sprachen, Build 2026) bleibt verfügbar, MAI-Transcribe-1 ist seit dem 20. August 2026 deprecated.

EU-Einordnung: Laut Microsoft-Learn-Regionsliste ist das MAI-Transcribe-Modell in eastus, northeurope, southeastasia und westus verfügbar – in der EU also nur über North Europe (Irland). Azure Speech verarbeitet und speichert Daten ausschließlich in der Region der Speech-Ressource, sodass eine Speech-Ressource in North Europe die Verarbeitung auf die EU begrenzt. Ein Deployment in Germany West Central ist für dieses Modell derzeit nicht möglich. Weil es sich um eine Preview ohne SLA handelt, empfehlen wir MAI-Transcribe-2 zunächst für Evaluierungen und nicht-kritische Workloads; für Produktivbetrieb bleibt der Blick auf die GA-Ankündigung nötig.

Die MAI-Familie im Überblick (Stand 3. September 2026)

ModellTypStandEU-Regionen laut Microsoft LearnHinweis
MAI-Transcribe-2Speech-to-TextPreview, 3. Sept. 2026North Europe60 Sprachen, 0,10 USD/h bis Ende 2026
MAI-Transcribe-1.5Speech-to-Textseit 2. Juni 2026North Europe43 Sprachen
MAI-Voice-2 / -2-FlashText-to-SpeechPreview, 2. Juni 2026France Central, Sweden Central, West Europe15 Sprachen, deutsche Stimmen Klaus und Mia
MAI-Image-2.5 / -Flash / -ProBildgenerierungPreview, 2./19. Juni 2026Sweden Central, West Europe (Global Standard)Prompts nur Englisch
MAI-Thinking-1Reasoning-LLMPreview, 2. Juni 2026alle EU-Regionen (Global Standard)256k Kontext, 64k Output
MAI-Code-1-FlashCoding-Modellseit 2. Juni 2026GitHub Copilot, Foundry, OpenRouter5B Parameter

Für die DSGVO-Bewertung ist der Deployment-Typ entscheidend: Die Speech-Modelle (Transcribe, Voice) verarbeiten regional in der gewählten Speech-Region, die Foundry-Modelle MAI-Thinking-1 und MAI-Image-2.5 laufen dagegen nur als Global Standard – die Inferenz kann damit in jeder Azure-Region stattfinden, eine EU Data Zone bietet Microsoft für die MAI-Modelle bislang nicht an.

MAI-Thinking-1 und MAI-Code-1-Flash (Juni 2026)

Auf der Build 2026 (2. Juni 2026) hat Microsoft die ersten vollständig hauseigenen Foundation-Modelle vorgestellt – trainiert ohne OpenAI-Distillation und ausschließlich auf kommerziell lizenzierten Daten. Aus DACH-Sicht besonders relevant:

  • MAI-Thinking-1: Sparse Mixture-of-Experts mit 35B aktiven Parametern und 256k Kontextfenster (64k Output). Erreicht laut Microsoft 97,0 % AIME 2025, 94,5 % AIME 2026 und 52,8 % SWE-Bench Pro. In Microsoft Foundry als Public Preview über eine OpenAI-kompatible Chat-Completions-API (/mai/v1) mit Function Calling und verschlüsselter Chain-of-Thought – ausschließlich als Global Standard (kein PTU), laut Regionsliste aus allen europäischen Foundry-Regionen inklusive Germany West Central deploybar, aber ohne EU Data Zone.
  • MAI-Code-1-Flash: 5B-Parameter-Coding-Modell, das laut Microsoft Claude Haiku 4.5 auf allen vier getesteten Coding-Benchmarks übertrifft (auf SWE-Bench Pro 51,2 % vs. 35,2 %). Ab dem 2. Juni 2026 in GitHub Copilot (Free, Pro, Pro+, Max) für VS Code ausgerollt, zusätzlich über OpenRouter, Fireworks und Baseten.

Beide Modelle sind Teil der MAI-Familie (siehe Tabelle oben) und reduzieren Microsofts Abhängigkeit von OpenAI deutlich. Sie sind allerdings nicht Open Source – wer volle Datenkontrolle braucht, bleibt bei Phi.

Neu: Phi-4-reasoning-vision (März 2026)

Microsoft hat mit Phi-4-reasoning-vision-15B ein neues Modell veröffentlicht, das Vision und Reasoning in einem 15B-Parameter-Modell kombiniert. Das Modell kann eigenständig entscheiden, wann tieferes Reasoning erforderlich ist – eine wichtige Fähigkeit für effiziente lokale Deployments.

  • 15B Parameter: Mehr Kapazität als Phi-4 (14B)
  • Vision + Reasoning: Versteht Bilder und kann komplexe Schlussfolgerungen ziehen
  • MIT-Lizenz: Vollständige kommerzielle Nutzung erlaubt
  • Self-Hosting: Läuft auf RTX 4090 oder M2 Mac

Small Language Models (SLMs)

Microsoft Phi ist Microsofts Familie von “Small Language Models” - kompakte, aber leistungsstarke Modelle, die speziell für Effizienz optimiert sind.

Warum Phi für Unternehmen?

  • Kompakt: 3.8B bis 14B Parameter
  • Effizient: Laeuft auf Consumer-Hardware
  • MIT-Lizenz: Volle kommerzielle Nutzung erlaubt
  • Self-Hosting: Volle Datenkontrolle
  • Edge-fähig: Smartphones, IoT, Embedded

Besondere Stärken

Effizienz

Phi-Modelle erreichen beeindruckende Leistung bei minimaler Größe:

ModellParameterVergleichbare Leistung zu
Phi-414BGPT-4 (teilweise)
Phi-3.5-MoE42B (6.6B aktiv)Llama 3 70B
Phi-3.5-mini3.8BLlama 3 8B

Lokales Deployment

Phi-Modelle können vollständig lokal betrieben werden:

  • Ollama: ollama run phi4
  • LM Studio: Einfache GUI
  • vLLM: Produktions-Deployment
  • ONNX: Optimierte Inferenz

Hardware-Anforderungen

ModellRAM/VRAMEmpfohlene Hardware
Phi-416 GBRTX 4070 / M2 Mac
Phi-3.5-MoE24 GBRTX 4090
Phi-3.5-mini4 GBLaptop / Smartphone
Phi-3.5-vision8 GBRTX 3060

Reasoning-Stärke

Phi-4 zeigt besonders starke Reasoning-Fähigkeiten:

  • Mathematik und Logik
  • Coding-Aufgaben
  • Strukturierte Analyse
  • Chain-of-Thought

Vergleich zu anderen SLMs

FeaturePhi-4Llama 3.2 3BGemma 2 2B
Parameter14B3B2B
ReasoningStarkMittelMittel
CodingStarkGutGut
VisionJa (3.5)NeinNein
LizenzMITCommunityApache 2.0

Integration mit CompanyGPT

Microsoft Phi kann in CompanyGPT als Self-Hosted-Option integriert werden - ideal für Unternehmen, die KI ohne Cloud-Abhängigkeit betreiben möchten.

Unsere Empfehlung

Für Transkription im Microsoft-Stack ist seit dem 3. September 2026 MAI-Transcribe-2 die erste Wahl für Evaluierungen: 60 Sprachen inklusive Deutsch, Diarisierung und Timestamps im Grundpreis von 0,10 USD pro Stunde, EU-Verarbeitung über eine Speech-Ressource in North Europe. Weil das Modell noch Public Preview ohne SLA ist, planen wir es für Produktiv-Workloads erst mit der GA ein; bis dahin bleiben GPT-Realtime-Whisper und Whisper beziehungsweise ElevenLabs Scribe die produktiven Alternativen. Für deutschsprachige Sprachausgabe lohnt der Test von MAI-Voice-2 (Stimmen Klaus und Mia) aus West Europe oder Sweden Central.

Für Reasoning-intensive Cloud-Workloads auf Azure / Foundry ist MAI-Thinking-1 seit Juni 2026 unsere Empfehlung im Microsoft-Stack – mit dem Vorbehalt, dass es nur als Global Standard läuft und damit keine EU-Verarbeitungszusage bietet. Für Coding-Assistenten in GitHub Copilot bietet MAI-Code-1-Flash ein sehr gutes Preis-Leistungs-Verhältnis.

Für lokale und Edge-Deployments mit Vision- und Reasoning-Anforderungen empfehlen wir weiterhin Microsoft Phi-4-reasoning-vision-15B. Für reine Text-Aufgaben bleibt Phi-4 eine ausgezeichnete Wahl. Für Smartphones und IoT eignet sich Phi-3.5-mini, für einfachere multimodale Anwendungen Phi-3.5-vision.

Für Anwendungen, die maximale Qualität erfordern und Cloud-Hosting akzeptabel ist, empfehlen wir stattdessen OpenAI GPT oder Anthropic Claude.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Häufig gestellte Fragen

Was ist MAI-Transcribe-2 und was kostet es?

MAI-Transcribe-2 ist das am 3. September 2026 vorgestellte Speech-to-Text-Modell von Microsoft AI, verfügbar als Public Preview über Azure Speech in Microsoft Foundry, im MAI Playground und über OpenRouter. Es transkribiert 60 Sprachen inklusive Deutsch mit Speaker-Diarisierung, Word-Timestamps, Keyword-Biasing und Code-Switching. Der Preis beträgt 0,10 USD pro Stunde Audio als befristetes Angebot bis Ende 2026 (MAI-Transcribe-1: 0,36 USD pro Stunde).

Ist MAI-Transcribe-2 DSGVO-konform in der EU nutzbar?

Laut Microsoft-Learn-Regionsliste ist das MAI-Transcribe-Modell in eastus, northeurope, southeastasia und westus verfügbar, in der EU also über North Europe (Irland). Azure Speech verarbeitet und speichert Daten ausschließlich in der Region der Speech-Ressource, sodass die Verarbeitung mit einer Ressource in North Europe in der EU bleibt. Germany West Central wird für dieses Modell derzeit nicht angeboten, und die Preview läuft ohne SLA.

Welche MAI-Modelle gibt es von Microsoft?

Stand 3. September 2026: MAI-Transcribe-2 und MAI-Transcribe-1.5 (Speech-to-Text), MAI-Voice-2 und MAI-Voice-2-Flash (Text-to-Speech mit 15 Sprachen, darunter Deutsch), MAI-Image-2.5 mit den Varianten Flash und Pro (Bildgenerierung), MAI-Thinking-1 (Reasoning-LLM mit 256k Kontext) und MAI-Code-1-Flash (5B-Coding-Modell in GitHub Copilot). Alle sind proprietär und laufen über Microsoft Foundry; MAI-Transcribe-1 ist seit dem 20. August 2026 deprecated.

Gibt es MAI-Voice-2 mit deutschen Stimmen?

Ja. MAI-Voice-2 und MAI-Voice-2-Flash bieten laut Microsoft Learn die deutschen Stimmen de-DE-Klaus und de-DE-Mia mit steuerbaren Emotionen per SSML. Die MAI-Voices sind in der EU in France Central, Sweden Central und West Europe verfügbar; Instant Voice Cloning ist nur nach Limited-Access-Freigabe möglich. Beide Modelle sind Public Preview.

Laufen MAI-Thinking-1 und MAI-Image-2.5 mit EU-Datenresidenz?

Nein. Beide Modelle sind in Microsoft Foundry ausschließlich als Global Standard deploybar, MAI-Thinking-1 aus allen europäischen Foundry-Regionen inklusive Germany West Central, MAI-Image-2.5 aus Sweden Central und West Europe. Global Standard bedeutet, dass die Inferenz in jeder Azure-Region erfolgen kann; eine EU Data Zone bietet Microsoft für die MAI-Modelle bislang nicht an. Regionale Verarbeitung gibt es nur bei den Speech-Modellen MAI-Transcribe und MAI-Voice.

Wann lohnt sich Phi statt MAI?

Phi-Modelle (Phi-4, Phi-4-reasoning-vision-15B, Phi-3.5) sind Open Source und laufen lokal auf eigener Hardware oder am Edge, also mit voller Datenkontrolle und ohne Cloud-Abhängigkeit. Die MAI-Modelle sind proprietär, leistungsstärker und nur über Microsoft Foundry oder Azure Speech nutzbar. Wer maximale Datensouveränität braucht, wählt Phi; wer Reasoning, Transkription oder Sprachausgabe auf Frontier-Niveau im Microsoft-Stack will, evaluiert MAI.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.