Zum Hauptinhalt springen
9 – 17 UHR +49 8031 3508270 LUITPOLDSTR. 9, 83022 ROSENHEIM
DE / EN
LLM Meta USA

Meta Llama

Meta Llama und Muse Spark – von Open-Source-LLMs zum proprietären Muse Spark 1.1 (9. Juli 2026, Metas erstes kostenpflichtiges Closed-Weights-Modell). Achtung: Llama 4 ist in der EU lizenzrechtlich nicht verfügbar, Muse Spark nur für US-Entwickler. KI-Beratung Rosenheim für Llama 3.x Deployment.

Lizenz Llama 4 Community License (EU-Nutzung ausgeschlossen), Llama 3.x Community License (EU erlaubt)
DSGVO-Hosting Verfügbar
Kontext 10M (Llama 4 Scout), 1M (Llama 4 Maverick), 128k (Llama 3.x) Tokens
Modalität Text, Image, Video → Text

Versionen

Verfügbare Modellvarianten im Überblick

ModellReleaseEUStärkenSchwächenStatus
Muse Spark 1.1
9. Juli 2026
Agentisches Multimodal-Modell mit Tool Use, Computer Use und parallelen Subagenten 1M Token Kontextfenster mit modellgesteuertem Kontext-Management, kein Langkontext-Aufpreis Aggressiver Preis: $1,25/1M Input, $4,25/1M Output ($0,15 Cached Input) Stark bei Tool-Use-Benchmarks (MCP Atlas 88,1 – laut Meta vor Claude Opus 4.8 und GPT-5.5) OpenAI-kompatible 'Meta Model API'
Closed Weights – erstes kostenpflichtiges, proprietäres Meta-Modell API nur als Public Preview mit Warteliste, zunächst nur für US-Entwickler – keine EU-Verfügbarkeit Keine DSGVO-Zusagen, kein AVV, keine EU-Datenresidenz kommuniziert Bei reinem Coding hinter Claude Opus 4.8 und GPT-5.5 (SWE-Bench Pro 61,5 %) Parameterzahl und Knowledge Cutoff nicht offengelegt
Aktuell
Muse Spark 1.0
8. April 2026
Erstes Modell von Meta Superintelligence Labs (MSL) Powert Meta AI Assistent Nativ multimodales Reasoning-Modell mit Tool-Use und visual chain-of-thought Multi-Agent Orchestrierung (Contemplating Mode)
Proprietäres Modell – Bruch mit Metas Open-Weight-Tradition Developer-API mehrfach verschoben (April → Mai → Juni 2026) EU-Verfügbarkeit und vollständige Spezifikationen nie veröffentlicht
Veraltet
Llama 4 Maverick
April 2025
400B Parameter (MoE, 17B aktiv) 1M Token Kontextfenster Nativ multimodal (Text, Bild, Video) Übertrifft GPT-4 in mehreren Benchmarks
In der EU lizenzrechtlich nicht verfügbar Multi-GPU erforderlich (200-400 GB VRAM)
Aktuell
Llama 4 Scout
April 2025
10M Token Kontextfenster – branchenweit einzigartig 109B Parameter (MoE, 17B aktiv) Auf einzelner H100 80GB lauffähig (INT4) Nativ multimodal
In der EU lizenzrechtlich nicht verfügbar
Aktuell
Llama 3.3 70B Empfohlen
Dezember 2024
Bewährt und breit eingesetzt Gute Balance Leistung/Ressourcen
Kein multimodales Input
Aktuell
Llama 3.2 (1B/3B/11B/90B)
September 2024
Breite Größenpalette Kompakte Varianten für Edge
Ältere Generation
Aktuell
Llama 3.1 (405B/70B/8B)
Juli 2024
405B-Variante mit Spitzenleistung 128k Kontextfenster
Hoher Ressourcenbedarf (405B)
Aktuell

Einsatzbereiche

Typische Anwendungsgebiete für dieses Modell

Datensensible Anwendungen
High-Volume ohne API-Kosten
Offline-Szenarien
Custom Models / Fine-Tuning
Embedded AI
Edge Deployment
On-Premise Lösungen

Technische Details

API, Features und Capabilities

API & Verfügbarkeit
Verfügbarkeit Public
Latenz (TTFT) Abhängig von Hosting
Durchsatz Abhängig von Hardware Tokens/Sek
Features & Capabilities
Tool Use Function Calling Structured Output Vision Datei-Upload
Training & Wissen
Wissensstand Nicht offengelegt (Muse Spark 1.1), 2024-12 (Llama 4), 2024-08 (Llama 3.3)
Fine-Tuning Verfügbar (LoRA, QLoRA, Full Fine-Tuning, PEFT)
Sprachunterstützung
Beste Qualität Englisch, Deutsch, Französisch, Spanisch
Unterstützt 50+ Sprachen
Beste Qualität in Englisch, gute Qualität in westeuropaeischen Sprachen

Hosting & Compliance

DSGVO-konforme Hosting-Optionen und Lizenzierung

DSGVO-konforme Hosting-Optionen
Self-Hosted
Eigene Infrastruktur
Volle Datenkontrolle - empfohlen für sensible Daten
AWS
Frankfurt (eu-central-1)
Amazon Bedrock / SageMaker
Azure
West Europe
Azure AI / ML
Google Cloud
Frankfurt (europe-west3)
Vertex AI
Lizenz & Hosting
Lizenz Llama 4 Community License (EU-Nutzung ausgeschlossen), Llama 3.x Community License (EU erlaubt)
Sicherheitsfilter Anpassbar
On-Premise Edge-fähig

innFactory AI Consulting aus Rosenheim unterstützt Unternehmen im DACH-Raum beim DSGVO-konformen Self-Hosting von Meta Llama. Mit Open Weights haben Sie volle Kontrolle – keine Daten verlassen Ihre Infrastruktur.

Muse Spark 1.1: Metas erstes kostenpflichtiges Modell (9. Juli 2026)

Am 9. Juli 2026 haben die Meta Superintelligence Labs (MSL) unter Chief AI Officer Alexandr Wang Muse Spark 1.1 veröffentlicht – Metas erstes kostenpflichtiges Closed-Weights-Modell und damit der endgültige Bruch mit der Open-Weight-Tradition der Llama-Familie. Mark Zuckerberg positioniert es als „starkes agentisches und Coding-Modell zu einem sehr niedrigen Preis“.

Die Eckdaten:

  • Agentisches Multimodal-Modell für Tool Use, Computer Use, Coding und multimodales Verstehen; kann parallele Subagenten starten.
  • 1 Million Token Kontextfenster, wobei das Modell seinen Kontext selbst verwaltet (Behalten, Abrufen, Komprimieren) – ohne Langkontext-Aufpreis.
  • Aggressiver Preis: $1,25/1M Input-Token, $4,25/1M Output-Token, $0,15 für Cached Input – deutlich unter den Frontier-Preisen von OpenAI und Anthropic.
  • Benchmarks: Stark bei Tool Use (MCP Atlas 88,1 – laut Metas eigenen Charts vor Claude Opus 4.8 und GPT-5.5), bei reinem Coding aber hinter den Frontier-Modellen (SWE-Bench Pro 61,5 %, Terminal-Bench 2.1 80,0).
  • Verfügbarkeit: Über die neue, OpenAI-kompatible Meta Model API – allerdings nur als Public Preview mit Warteliste und zunächst ausschließlich für US-Entwickler. Für Consumer läuft Muse Spark 1.1 als „Thinking“-Modus in der Meta-AI-App und auf meta.ai.
  • Nicht offengelegt: Parameterzahl, Architekturdetails und Knowledge Cutoff.

Strategisch soll Muse Spark die Llama-Modelle in WhatsApp, Instagram, Facebook, Messenger und Metas AI-Brillen ersetzen. Bereits am 7. Juli 2026 hatte MSL mit Muse Image zudem sein erstes Bildgenerierungsmodell vorgestellt (Text-zu-Bild, Bildbearbeitung, Multi-Foto-Kompositing) – datenschutzrechtlich umstritten, weil das @-Mention-Feature standardmäßig Bilder auf Basis öffentlicher Instagram-Profilfotos generiert (Opt-out statt Opt-in).

Hinweis für EU-Unternehmen: Die Meta Model API ist nicht in der EU verfügbar (Preview auf US-Entwickler beschränkt). Meta hat weder DSGVO-Zusagen noch einen Auftragsverarbeitungsvertrag oder EU-Datenresidenz kommuniziert, ein EU-Rollout-Zeitplan existiert nicht. Für produktive EU-Anwendungen empfehlen wir weiterhin Llama 3.3 70B (Self-Hosting) oder Mistral als europäische Alternative.

Wichtiger Hinweis: EU-Lizenzrestriktion bei Llama 4

Die Llama 4 Community License schließt die Nutzung und Verteilung innerhalb der EU explizit aus. Unternehmen mit Sitz oder Hauptniederlassung in der EU dürfen Llama 4 Scout und Maverick weder nutzen noch hosten. Für EU-Unternehmen empfehlen wir daher Llama 3.3 70B oder alternativ Mistral als europäische Open-Source-Alternative.

Llama 4: Technische Spitzenleistung – ohne EU-Zugang

Llama 4 Maverick (400B MoE)

  • 128 Experten, 17B aktive Parameter pro Token
  • 1M Token Kontextfenster
  • Nativ multimodal (Text, Bild, Video)
  • Übertrifft GPT-4 in Reasoning- und Coding-Benchmarks

Llama 4 Scout (109B MoE)

  • 16 Experten, 17B aktive Parameter
  • 10M Token Kontextfenster – branchenweit einzigartig
  • Auf einer einzelnen H100 80GB (INT4) lauffähig
  • Ideal für massive Dokumentenanalyse und Codebase-Parsing

Llama 4 Behemoth (angekündigt)

  • ~2 Billionen Parameter, 288B aktiv
  • Wurde angekündigt, aber nie veröffentlicht. Durch Muse Spark abgelöst.
  • Positioniert als “Teacher-Modell” für andere Llama-Modelle

Llama 3.x: Empfohlen für EU-Unternehmen

Die Llama 3.x-Serie unterliegt keiner EU-Restriktion und bleibt für europäische Unternehmen die empfohlene Wahl:

Besondere Stärken

  • Volle Kontrolle: Modell läuft in Ihrer Infrastruktur
  • Keine API-Kosten: Nur Hardware-/Cloud-Kosten
  • Anpassbar: Fine-Tuning auf eigene Daten möglich
  • DSGVO-freundlich: Keine Daten verlassen Ihr Unternehmen

Hardware-Anforderungen

ModellVRAMEmpfohlene GPU
Llama 4 Scout80+ GBH100 / A100
Llama 4 Maverick400+ GBMulti-H100
Llama 3.3 70B40+ GBA100 80GB
Llama 3.2 11B24 GBRTX 4090
Llama 3.2 3B8 GBRTX 4070
Llama 3.2 1B4 GBSmartphone

Integration mit CompanyGPT

CompanyGPT unterstützt Llama 3.x-Modelle und ermöglicht den vollständig selbst-gehosteten Betrieb ohne externe Abhängigkeiten.

Unsere Empfehlung

Für EU-Unternehmen ist Llama 3.3 70B die beste Wahl aus der Llama-Familie – bewährt, EU-kompatibel und mit gutem Leistungsprofil. Für Edge-Anwendungen eignen sich die kompakten Llama 3.2 (1B/3B) Modelle. Sollten Sie eine leistungsstarke europäische Open-Source-Alternative suchen, empfehlen wir Mistral als Llama-4-Ersatz für den DACH-Raum.

Kostenkalkulation für dieses Modell

Eine aktuelle Übersicht über Token-Preise, Modellvarianten und EU-Verfügbarkeit finden Sie auf unserem Schwesterprojekt ai-prices.eu. Dort lassen sich die laufenden Betriebskosten für Ihren konkreten Anwendungsfall vergleichen und abschätzen.

Preise auf ai-prices.eu vergleichen

ai-prices.eu ist ein Projekt der innFactory AI Consulting GmbH und hilft bei der transparenten Preisabschätzung führender KI-Modelle.

Beratung zu diesem Modell?

Wir helfen Ihnen bei der Auswahl und Integration des richtigen KI-Modells für Ihren Anwendungsfall.