Als KI-Beratung aus Rosenheim empfehlen wir Microsoft Phi für Unternehmen im DACH-Raum, die leistungsstarke KI auf ressourcenbeschränkter Hardware betreiben möchten. Seit der Veröffentlichung von Phi-4 im Dezember 2024 haben sich die Phi-Modelle als zuverlässige Lösung für Edge- und On-Premise-Deployments etabliert und bieten beeindruckende Leistung bei minimalen Anforderungen. Mit der MAI-Familie (Build 2026) erweitert Microsoft das eigene Modell-Portfolio nun um vollständig hauseigene Reasoning- und Coding-Modelle.
Neu: MAI-Transcribe-2 – Speech-to-Text in 60 Sprachen (3. September 2026)
Am 3. September 2026 hat Microsoft AI MAI-Transcribe-2 vorgestellt und als Public Preview in Microsoft Foundry, im MAI Playground und über OpenRouter bereitgestellt. Das Modell transkribiert 60 Sprachen – darunter Deutsch – und erreicht laut Microsoft auf dem FLEURS-Benchmark Platz 1 bei durchschnittlich 5,2 % Wortfehlerrate; auf dem unabhängigen Artificial-Analysis-WER-Leaderboard liegt es nach Microsoft-Angaben auf Platz 2. Bei der Geschwindigkeit nennt Microsoft bis zu 10× schneller als OpenAI GPT-Transcribe, 7× schneller als ElevenLabs Scribe v2 und 5× schneller als Gemini 3.5 Transcribe. Der Preis liegt bei 0,10 USD pro Stunde Audio als befristetes Angebot bis Ende 2026 (MAI-Transcribe-1: 0,36 USD pro Stunde) – Diarisierung, Word-Timestamps und Keyword-Biasing sind darin enthalten.
Funktionen: Speaker-Diarisierung, Word-Level-Timestamps, Keyword-Biasing über eine Phrasenliste, automatische Spracherkennung, Code-Switching innerhalb einer Äußerung, Rauschrobustheit und wählbarer Transkriptionsstil (verbatim mit Füllwörtern für Compliance und QA, clean für Protokolle und Untertitel). Aufgerufen wird das Modell über die Fast-Transcription-API von Azure Speech (enhancedMode.model = "MAI-Transcribe-2", Dateien bis 300 MB in WAV, MP3 oder FLAC) oder als Eingabe-Transkription in der Voice Live API. MAI-Transcribe-1.5 (43 Sprachen, Build 2026) bleibt verfügbar, MAI-Transcribe-1 ist seit dem 20. August 2026 deprecated.
EU-Einordnung: Laut Microsoft-Learn-Regionsliste ist das MAI-Transcribe-Modell in eastus, northeurope, southeastasia und westus verfügbar – in der EU also nur über North Europe (Irland). Azure Speech verarbeitet und speichert Daten ausschließlich in der Region der Speech-Ressource, sodass eine Speech-Ressource in North Europe die Verarbeitung auf die EU begrenzt. Ein Deployment in Germany West Central ist für dieses Modell derzeit nicht möglich. Weil es sich um eine Preview ohne SLA handelt, empfehlen wir MAI-Transcribe-2 zunächst für Evaluierungen und nicht-kritische Workloads; für Produktivbetrieb bleibt der Blick auf die GA-Ankündigung nötig.
Die MAI-Familie im Überblick (Stand 3. September 2026)
| Modell | Typ | Stand | EU-Regionen laut Microsoft Learn | Hinweis |
|---|---|---|---|---|
| MAI-Transcribe-2 | Speech-to-Text | Preview, 3. Sept. 2026 | North Europe | 60 Sprachen, 0,10 USD/h bis Ende 2026 |
| MAI-Transcribe-1.5 | Speech-to-Text | seit 2. Juni 2026 | North Europe | 43 Sprachen |
| MAI-Voice-2 / -2-Flash | Text-to-Speech | Preview, 2. Juni 2026 | France Central, Sweden Central, West Europe | 15 Sprachen, deutsche Stimmen Klaus und Mia |
| MAI-Image-2.5 / -Flash / -Pro | Bildgenerierung | Preview, 2./19. Juni 2026 | Sweden Central, West Europe (Global Standard) | Prompts nur Englisch |
| MAI-Thinking-1 | Reasoning-LLM | Preview, 2. Juni 2026 | alle EU-Regionen (Global Standard) | 256k Kontext, 64k Output |
| MAI-Code-1-Flash | Coding-Modell | seit 2. Juni 2026 | GitHub Copilot, Foundry, OpenRouter | 5B Parameter |
Für die DSGVO-Bewertung ist der Deployment-Typ entscheidend: Die Speech-Modelle (Transcribe, Voice) verarbeiten regional in der gewählten Speech-Region, die Foundry-Modelle MAI-Thinking-1 und MAI-Image-2.5 laufen dagegen nur als Global Standard – die Inferenz kann damit in jeder Azure-Region stattfinden, eine EU Data Zone bietet Microsoft für die MAI-Modelle bislang nicht an.
MAI-Thinking-1 und MAI-Code-1-Flash (Juni 2026)
Auf der Build 2026 (2. Juni 2026) hat Microsoft die ersten vollständig hauseigenen Foundation-Modelle vorgestellt – trainiert ohne OpenAI-Distillation und ausschließlich auf kommerziell lizenzierten Daten. Aus DACH-Sicht besonders relevant:
- MAI-Thinking-1: Sparse Mixture-of-Experts mit 35B aktiven Parametern und 256k Kontextfenster (64k Output). Erreicht laut Microsoft 97,0 % AIME 2025, 94,5 % AIME 2026 und 52,8 % SWE-Bench Pro. In Microsoft Foundry als Public Preview über eine OpenAI-kompatible Chat-Completions-API (
/mai/v1) mit Function Calling und verschlüsselter Chain-of-Thought – ausschließlich als Global Standard (kein PTU), laut Regionsliste aus allen europäischen Foundry-Regionen inklusive Germany West Central deploybar, aber ohne EU Data Zone. - MAI-Code-1-Flash: 5B-Parameter-Coding-Modell, das laut Microsoft Claude Haiku 4.5 auf allen vier getesteten Coding-Benchmarks übertrifft (auf SWE-Bench Pro 51,2 % vs. 35,2 %). Ab dem 2. Juni 2026 in GitHub Copilot (Free, Pro, Pro+, Max) für VS Code ausgerollt, zusätzlich über OpenRouter, Fireworks und Baseten.
Beide Modelle sind Teil der MAI-Familie (siehe Tabelle oben) und reduzieren Microsofts Abhängigkeit von OpenAI deutlich. Sie sind allerdings nicht Open Source – wer volle Datenkontrolle braucht, bleibt bei Phi.
Neu: Phi-4-reasoning-vision (März 2026)
Microsoft hat mit Phi-4-reasoning-vision-15B ein neues Modell veröffentlicht, das Vision und Reasoning in einem 15B-Parameter-Modell kombiniert. Das Modell kann eigenständig entscheiden, wann tieferes Reasoning erforderlich ist – eine wichtige Fähigkeit für effiziente lokale Deployments.
- 15B Parameter: Mehr Kapazität als Phi-4 (14B)
- Vision + Reasoning: Versteht Bilder und kann komplexe Schlussfolgerungen ziehen
- MIT-Lizenz: Vollständige kommerzielle Nutzung erlaubt
- Self-Hosting: Läuft auf RTX 4090 oder M2 Mac
Small Language Models (SLMs)
Microsoft Phi ist Microsofts Familie von “Small Language Models” - kompakte, aber leistungsstarke Modelle, die speziell für Effizienz optimiert sind.
Warum Phi für Unternehmen?
- Kompakt: 3.8B bis 14B Parameter
- Effizient: Laeuft auf Consumer-Hardware
- MIT-Lizenz: Volle kommerzielle Nutzung erlaubt
- Self-Hosting: Volle Datenkontrolle
- Edge-fähig: Smartphones, IoT, Embedded
Besondere Stärken
Effizienz
Phi-Modelle erreichen beeindruckende Leistung bei minimaler Größe:
| Modell | Parameter | Vergleichbare Leistung zu |
|---|---|---|
| Phi-4 | 14B | GPT-4 (teilweise) |
| Phi-3.5-MoE | 42B (6.6B aktiv) | Llama 3 70B |
| Phi-3.5-mini | 3.8B | Llama 3 8B |
Lokales Deployment
Phi-Modelle können vollständig lokal betrieben werden:
- Ollama:
ollama run phi4 - LM Studio: Einfache GUI
- vLLM: Produktions-Deployment
- ONNX: Optimierte Inferenz
Hardware-Anforderungen
| Modell | RAM/VRAM | Empfohlene Hardware |
|---|---|---|
| Phi-4 | 16 GB | RTX 4070 / M2 Mac |
| Phi-3.5-MoE | 24 GB | RTX 4090 |
| Phi-3.5-mini | 4 GB | Laptop / Smartphone |
| Phi-3.5-vision | 8 GB | RTX 3060 |
Reasoning-Stärke
Phi-4 zeigt besonders starke Reasoning-Fähigkeiten:
- Mathematik und Logik
- Coding-Aufgaben
- Strukturierte Analyse
- Chain-of-Thought
Vergleich zu anderen SLMs
| Feature | Phi-4 | Llama 3.2 3B | Gemma 2 2B |
|---|---|---|---|
| Parameter | 14B | 3B | 2B |
| Reasoning | Stark | Mittel | Mittel |
| Coding | Stark | Gut | Gut |
| Vision | Ja (3.5) | Nein | Nein |
| Lizenz | MIT | Community | Apache 2.0 |
Integration mit CompanyGPT
Microsoft Phi kann in CompanyGPT als Self-Hosted-Option integriert werden - ideal für Unternehmen, die KI ohne Cloud-Abhängigkeit betreiben möchten.
Unsere Empfehlung
Für Transkription im Microsoft-Stack ist seit dem 3. September 2026 MAI-Transcribe-2 die erste Wahl für Evaluierungen: 60 Sprachen inklusive Deutsch, Diarisierung und Timestamps im Grundpreis von 0,10 USD pro Stunde, EU-Verarbeitung über eine Speech-Ressource in North Europe. Weil das Modell noch Public Preview ohne SLA ist, planen wir es für Produktiv-Workloads erst mit der GA ein; bis dahin bleiben GPT-Realtime-Whisper und Whisper beziehungsweise ElevenLabs Scribe die produktiven Alternativen. Für deutschsprachige Sprachausgabe lohnt der Test von MAI-Voice-2 (Stimmen Klaus und Mia) aus West Europe oder Sweden Central.
Für Reasoning-intensive Cloud-Workloads auf Azure / Foundry ist MAI-Thinking-1 seit Juni 2026 unsere Empfehlung im Microsoft-Stack – mit dem Vorbehalt, dass es nur als Global Standard läuft und damit keine EU-Verarbeitungszusage bietet. Für Coding-Assistenten in GitHub Copilot bietet MAI-Code-1-Flash ein sehr gutes Preis-Leistungs-Verhältnis.
Für lokale und Edge-Deployments mit Vision- und Reasoning-Anforderungen empfehlen wir weiterhin Microsoft Phi-4-reasoning-vision-15B. Für reine Text-Aufgaben bleibt Phi-4 eine ausgezeichnete Wahl. Für Smartphones und IoT eignet sich Phi-3.5-mini, für einfachere multimodale Anwendungen Phi-3.5-vision.
Für Anwendungen, die maximale Qualität erfordern und Cloud-Hosting akzeptabel ist, empfehlen wir stattdessen OpenAI GPT oder Anthropic Claude.
