innFactory AI Consulting aus Rosenheim unterstützt Unternehmen im DACH-Raum beim DSGVO-konformen Self-Hosting von Meta Llama. Mit Open Weights haben Sie volle Kontrolle – keine Daten verlassen Ihre Infrastruktur.
Muse Spark 1.1: Metas erstes kostenpflichtiges Modell (9. Juli 2026)
Am 9. Juli 2026 haben die Meta Superintelligence Labs (MSL) unter Chief AI Officer Alexandr Wang Muse Spark 1.1 veröffentlicht – Metas erstes kostenpflichtiges Closed-Weights-Modell und damit der endgültige Bruch mit der Open-Weight-Tradition der Llama-Familie. Mark Zuckerberg positioniert es als „starkes agentisches und Coding-Modell zu einem sehr niedrigen Preis“.
Die Eckdaten:
- Agentisches Multimodal-Modell für Tool Use, Computer Use, Coding und multimodales Verstehen; kann parallele Subagenten starten.
- 1 Million Token Kontextfenster, wobei das Modell seinen Kontext selbst verwaltet (Behalten, Abrufen, Komprimieren) – ohne Langkontext-Aufpreis.
- Aggressiver Preis: $1,25/1M Input-Token, $4,25/1M Output-Token, $0,15 für Cached Input – deutlich unter den Frontier-Preisen von OpenAI und Anthropic.
- Benchmarks: Stark bei Tool Use (MCP Atlas 88,1 – laut Metas eigenen Charts vor Claude Opus 4.8 und GPT-5.5), bei reinem Coding aber hinter den Frontier-Modellen (SWE-Bench Pro 61,5 %, Terminal-Bench 2.1 80,0).
- Verfügbarkeit: Über die neue, OpenAI-kompatible Meta Model API – allerdings nur als Public Preview mit Warteliste und zunächst ausschließlich für US-Entwickler. Für Consumer läuft Muse Spark 1.1 als „Thinking“-Modus in der Meta-AI-App und auf meta.ai.
- Nicht offengelegt: Parameterzahl, Architekturdetails und Knowledge Cutoff.
Strategisch soll Muse Spark die Llama-Modelle in WhatsApp, Instagram, Facebook, Messenger und Metas AI-Brillen ersetzen. Bereits am 7. Juli 2026 hatte MSL mit Muse Image zudem sein erstes Bildgenerierungsmodell vorgestellt (Text-zu-Bild, Bildbearbeitung, Multi-Foto-Kompositing) – datenschutzrechtlich umstritten, weil das @-Mention-Feature standardmäßig Bilder auf Basis öffentlicher Instagram-Profilfotos generiert (Opt-out statt Opt-in).
Hinweis für EU-Unternehmen: Die Meta Model API ist nicht in der EU verfügbar (Preview auf US-Entwickler beschränkt). Meta hat weder DSGVO-Zusagen noch einen Auftragsverarbeitungsvertrag oder EU-Datenresidenz kommuniziert, ein EU-Rollout-Zeitplan existiert nicht. Für produktive EU-Anwendungen empfehlen wir weiterhin Llama 3.3 70B (Self-Hosting) oder Mistral als europäische Alternative.
Wichtiger Hinweis: EU-Lizenzrestriktion bei Llama 4
Die Llama 4 Community License schließt die Nutzung und Verteilung innerhalb der EU explizit aus. Unternehmen mit Sitz oder Hauptniederlassung in der EU dürfen Llama 4 Scout und Maverick weder nutzen noch hosten. Für EU-Unternehmen empfehlen wir daher Llama 3.3 70B oder alternativ Mistral als europäische Open-Source-Alternative.
Llama 4: Technische Spitzenleistung – ohne EU-Zugang
Llama 4 Maverick (400B MoE)
- 128 Experten, 17B aktive Parameter pro Token
- 1M Token Kontextfenster
- Nativ multimodal (Text, Bild, Video)
- Übertrifft GPT-4 in Reasoning- und Coding-Benchmarks
Llama 4 Scout (109B MoE)
- 16 Experten, 17B aktive Parameter
- 10M Token Kontextfenster – branchenweit einzigartig
- Auf einer einzelnen H100 80GB (INT4) lauffähig
- Ideal für massive Dokumentenanalyse und Codebase-Parsing
Llama 4 Behemoth (angekündigt)
- ~2 Billionen Parameter, 288B aktiv
- Wurde angekündigt, aber nie veröffentlicht. Durch Muse Spark abgelöst.
- Positioniert als “Teacher-Modell” für andere Llama-Modelle
Llama 3.x: Empfohlen für EU-Unternehmen
Die Llama 3.x-Serie unterliegt keiner EU-Restriktion und bleibt für europäische Unternehmen die empfohlene Wahl:
Besondere Stärken
- Volle Kontrolle: Modell läuft in Ihrer Infrastruktur
- Keine API-Kosten: Nur Hardware-/Cloud-Kosten
- Anpassbar: Fine-Tuning auf eigene Daten möglich
- DSGVO-freundlich: Keine Daten verlassen Ihr Unternehmen
Hardware-Anforderungen
| Modell | VRAM | Empfohlene GPU |
|---|---|---|
| Llama 4 Scout | 80+ GB | H100 / A100 |
| Llama 4 Maverick | 400+ GB | Multi-H100 |
| Llama 3.3 70B | 40+ GB | A100 80GB |
| Llama 3.2 11B | 24 GB | RTX 4090 |
| Llama 3.2 3B | 8 GB | RTX 4070 |
| Llama 3.2 1B | 4 GB | Smartphone |
Integration mit CompanyGPT
CompanyGPT unterstützt Llama 3.x-Modelle und ermöglicht den vollständig selbst-gehosteten Betrieb ohne externe Abhängigkeiten.
Unsere Empfehlung
Für EU-Unternehmen ist Llama 3.3 70B die beste Wahl aus der Llama-Familie – bewährt, EU-kompatibel und mit gutem Leistungsprofil. Für Edge-Anwendungen eignen sich die kompakten Llama 3.2 (1B/3B) Modelle. Sollten Sie eine leistungsstarke europäische Open-Source-Alternative suchen, empfehlen wir Mistral als Llama-4-Ersatz für den DACH-Raum.
