Am 3. Juni 2026 startete Google ein kuratiertes lokales KI Ökosystem für macOS – bestehend aus dem KI Spielplatz AI Edge Gallery, dem encoderlosen multimodalen Modell Gemma 4 12B und der kostenlosen, offlinefähigen Di...

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's launch of on-device AI apps for macOS, including the AI Edge Gallery app's features, available Gemma mo. Article summary: On June 3, 2026, Google launched a trio of on-device AI products for macOS — AI Edge Gallery, the Gemma 4 12B model, and AI Edge Eloquent — forming a curated local AI ecosystem that competes directly with Ollama and LM S. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Google AI Edge Gallery launches on macOS, letting Mac users run Gemini models locally. In addition to Google AI Edge Gallery, which lets users run Gemma models locally on their M" source context "Google AI Edge Gallery launches on macOS, letting Mac users run Gemini models locally - 9to5Mac" Refe
Am 3. Juni 2026 hat Google ein Trio an geräteinternen KI-Produkten für macOS vorgestellt – AI Edge Gallery, das Modell Gemma 4 12B und AI Edge Eloquent. Zusammen bilden sie ein kuratiertes lokales KI-Ökosystem, das in direkter Konkurrenz zu etablierten lokalen Inferenz-Plattformen wie Ollama und LM Studio steht .
Doch dieser Launch ist mehr als nur die Veröffentlichung neuer Software. Es ist ein strategischer Schachzug, um eine ausgefeilte, verbraucherfreundliche Erfahrung im Bereich der lokalen KI zu bieten – wenn auch mit einem stärker kontrollierten „Walled Garden“-Ansatz .
AI Edge Gallery ist eine quelloffene, interaktive App, mit der Mac-Nutzer Googles Gemma-Modelle vollständig auf ihrer eigenen Hardware ausführen können. Dabei wird die Leistung von Apple Silicon für die Verarbeitung genutzt . Die App wurde als Schaufenster für geräteinterne KI konzipiert und bietet vorgefertigte Beispiele, transparente Leistungskennzahlen und direkte Links zur Dokumentation – ein Sprungbrett für Entwickler
.
Eine herausragende Funktion ist die Möglichkeit, Skripte – etwa für Datenanalyse-Aufgaben – spontan zu generieren und direkt in der App auszuführen .
Die Anwendung ist jetzt für macOS, iOS und Android verfügbar. Die macOS-Version rückt jedoch eine spezifische Strategie bei der Modellkuratierung in den Fokus . Anders als die offenen Bibliotheken von Ollama und LM Studio, die es Nutzern erlauben, nahezu jedes kompatible Modell zu laden, bietet die macOS AI Edge Gallery derzeit fünf von Google kuratierte Gemma-Modelle an
. Wie 9to5Mac berichtet, stehen folgende Modelle zur Auswahl: Gemma-4-12B-it, Gemma-4-E2B-it, Gemma-4-E4B-it, eine Gemma-4 26B-Variante und FunctionGemma-270M
. Diese handverlesene Auswahl ist der Kern von Googles Strategie: eine kontrollierte, qualitätsgesicherte Umgebung
.
Unter der Haube wird das Ökosystem von Googles LiteRT-LM-Inferenz-Engine angetrieben. Sie unterstützt CPU-, GPU- und NPU-Backends auf Linux, macOS und Windows . Das vorgestellte Modell für Leistungsbenchmarks bleibt Gemma-4-E2B (2,58 GB), und die offizielle Dokumentation gibt einen klaren Einblick in seine Fähigkeiten auf einem MacBook Pro M4
:
Der enorme Geschwindigkeitssprung durch GPU-Beschleunigung zeigt, wie gut Googles Stack für Apples Metal-API optimiert ist und ein nahezu sofortiges, flüssiges Benutzererlebnis liefert.
Unter der Apache-2.0-Lizenz veröffentlicht, ist Gemma 4 12B der Star dieses Launches . Seine Architektur ist das größte Alleinstellungsmerkmal. Es handelt sich um einen dichten, decoderbasierten Transformer, der dieselbe fortschrittliche Decoder-Struktur wie das viel größere Modell Gemma 4 31B Dense verwendet
.
Die entscheidende Innovation ist sein encoderloses multimodales Design. Die meisten multimodalen Modelle nutzen separate, sperrige Encoder für Bild (z. B. einen ViT) und Ton (z. B. Conformer-Schichten), um Daten für das Sprachmodell zu übersetzen . Gemma 4 12B eliminiert diese vollständig
. Stattdessen verwendet es:
Dadurch kann das Modell nativ Text, Bilder, Audio und Video in einem einzigen, einheitlichen Ablauf verarbeiten . Google behauptet, dass diese Architektur eine „Leistung nahe unseres 26B-MoE-Modells mit weniger als der Hälfte des Speichers“ liefere, und das auf Consumer-Laptops mit nur 16 GB Unified Memory
.
Benchmarks untermauern dieses Selbstbewusstsein und zeigen, dass das 12B-Modell deutlich über seiner Gewichtsklasse boxt. Bei GPQA Diamond (Argumentation auf Hochschulniveau) erreicht es beeindruckende 78,8 Punkte und liegt damit nahe an der 26B-Variante. Bei Multiple-Choice-Benchmarks wie MMLU Pro erreicht es 77,2 % und im anspruchsvollen Mathematik-Benchmark AIME 2026 77,5 % . Bei der Code-Generierung mit LiveCodeBench erreicht es einen Wert von 72,5 % und demonstriert robuste praktische Fähigkeiten in agentenbasierten Arbeitsabläufen und mehrstufigen Argumentationen
.
Abgerundet wird das Produkttrio durch Google AI Edge Eloquent, eine Diktier-App, die sich als direkte, kostenlose Alternative zu kostenpflichtigen Transkriptionsdiensten positioniert . Die App wird von Gemma-basierten Modellen angetrieben und ist von Grund auf für den vollständigen Offline-Betrieb konzipiert
.
Sie geht über eine einfache Transkription hinaus und fungiert als automatischer Sprachpolierer. Sie „entfernt aggressiv“ Füllwörter wie „ähm“ oder „ah“, korrigiert Grammatik in Echtzeit und strukturiert rohe, chaotische Sprache in zusammenhängenden, professionellen Text um . Das macht sie eher zu einem Kommunikations- als zu einem Notizwerkzeug. Das entscheidende Alleinstellungsmerkmal ist der Preis: Es gibt kein Abonnement und keine Nutzungsbeschränkung
. Die macOS-Version setzt macOS 13.0 oder neuer und einen Apple M1 Chip oder neuer voraus, wobei der App-Store-Eintrag anmerkt, dass einige erweiterte, optionale Funktionen eine Cloud-Verarbeitung erfordern können
.
Dieser Launch etabliert zwei gegensätzliche Philosophien für lokale KI. Googles Strategie ist ein „Walled Garden“-Ansatz: eine kuratierte, von Google genehmigte Auswahl an Modellen, eng integriert mit markengebundenen Erstanbieter-Apps (Gallery zum Erkunden, Eloquent für Diktate) und einer einheitlichen Inferenz-Engine (LiteRT-LM) mit CLI und Python-API . Das Ziel ist ein nahtloses, verbraucherfreundliches Erlebnis, das direkt nach dem Auspacken „einfach funktioniert“.
Dies steht im direkten Gegensatz zu Ollama und LM Studio, die als offene Bibliotheken maximale Flexibilität und Auswahl priorisieren und bei denen Nutzer jedes kompatible Modell laden können . Bemerkenswert ist, dass sowohl Ollama als auch LM Studio bereits das offene Modell Gemma 4 12B unterstützen, Googles Modell also nicht exklusiv an den eigenen Stack gebunden ist
.
Googles Vorteil liegt in der Erstanbieter-Optimierung, bei der die eigenen Modelle speziell für die eigene Inferenz-Engine auf Apple Silicon abgestimmt sind, was zu besserer Leistung und geringerem Speicherverbrauch führt. Der Kompromiss für den Nutzer ist klar: Man erhält eine ausgefeiltere und integriertere Erfahrung, kann aber keine Modelle außerhalb der kuratierten Gemma-Familie von Google ausführen. Dies positioniert Google, um Nutzer zu gewinnen, die Wert auf Zuverlässigkeit und Benutzerfreundlichkeit anstelle von experimenteller Freiheit legen, und schafft eine deutliche Weggabelung für lokale KI auf dem Mac.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Am 3. Juni 2026 startete Google ein kuratiertes lokales KI Ökosystem für macOS – bestehend aus dem KI Spielplatz AI Edge Gallery, dem encoderlosen multimodalen Modell Gemma 4 12B und der kostenlosen, offlinefähigen Di...
Am 3. Juni 2026 startete Google ein kuratiertes lokales KI Ökosystem für macOS – bestehend aus dem KI Spielplatz AI Edge Gallery, dem encoderlosen multimodalen Modell Gemma 4 12B und der kostenlosen, offlinefähigen Di... Gemma 4 12B verarbeitet Text, Bilder, Audio und Video ohne separate Encoder und läuft bereits auf Laptops mit 16 GB RAM.
Googles ‚Walled Garden‘ Ansatz setzt auf ein nahtloses Nutzererlebnis und Optimierung aus erster Hand, beschränkt Nutzer jedoch auf eine handverlesene Auswahl an Gemma Modellen.