Zum Hauptinhalt springen
16. Juli 202614:27

Alle Gemma-Modelle im Vergleich

Von Samuel Gregory

Über dieses Video

Hören Sie auf, Ihre Intelligenz aus der Cloud zu mieten, und werden Sie selbst zum Eigentümer. Dieses Video befasst sich mit der Gemma-Suite von Google, einer Sammlung von Open-Source-KI-Modellen, die für den Einsatz auf der Hardware konzipiert sind, die Sie bereits besitzen. Vom blitzschnellen 2B-Modell für mobile Geräte bis hin zum hochintelligenten 31B-Dense-Modell – wir zeigen Ihnen, welche Version für Ihre spezifischen Geschäftsabläufe die richtige ist. Wir testen ihre Logik anhand komplexer Quizfragen und zeigen, wie man mit MLX und Open Web UI einen privaten KI-Server auf einem MacBook einrichtet. Die wichtigsten Erkenntnisse: - Den Unterschied zwischen „Mixture of Experts“ (MoE)- und „Dense“-Modellen für geschäftliche Aufgaben verstehen. - Warum das 12B-Modell der „Sweet Spot“ für professionelle Laptop-Nutzer ist. - Wie man Datenschutzbedenken in der Cloud umgeht, indem man KI lokal hostet. - Ein Leistungsvergleich, der zeigt, warum größere Modelle für die sachliche Genauigkeit unerlässlich sind. - Ein Schritt-für-Schritt-Überblick über den OMLX- und Open Web UI-Tech-Stack.

Leitfaden für Führungskräfte zur lokalen KI-Souveränität

Cloud-KI ist ein Risiko, das die meisten Gründer einfach ignorieren. Jedes Mal, wenn Sie ein vertrauliches Strategiedokument oder einen firmeneigenen Codeausschnitt in ein webbasiertes LLM einfügen, geben Sie geistiges Eigentum preis. Google Gemma verändert die Situation, indem es modernste Intelligenz direkt auf Ihre lokale Hardware bringt.

Das Spektrum der Intelligenz

Google hat eine Reihe von Modellen veröffentlicht, die auf unterschiedliche geschäftliche Anforderungen zugeschnitten sind – von „Mobile-First“-Assistenten bis hin zu leistungsstarken Recherchetools.

Mikromodelle: 2B und 4B

Das sind die Leichtgewichte der Familie. Zwar haben sie den Johto-Arenaleiter-Quiz-Test nicht bestanden, doch bei knappen, schnellen Aufgaben sind sie unschlagbar. Für einen Geschäftsführer sind sie so etwas wie lokale Rechtschreibprüfer, Definitionslieferanten und einfache Textverarbeitungsprogramme. Sie laufen auf handelsüblichen Mobiltelefonen oder sogar auf einem Raspberry Pi mit einer Latenz von nahezu null.

Der Sweet Spot: 12B und 26B MoE

Beim 12B-Modell erkennen wir erstmals den praktischen Nutzen für Arbeitsabläufe. Der wahre Star für Gründer ist jedoch das 26B-„Mixture of Experts“ (MoE)-Modell. Da pro Token nur ein Bruchteil seiner Parameter (4B) aktiviert wird, bietet es hochgeschwindigkeitsfähige Intelligenz, ohne dass eine Serverfarm erforderlich ist. Dies ist Ihre erste Wahl für agentische Aufgaben, Unterstützung beim Programmieren und automatisierte Arbeitsabläufe.

Der Schwergewichtler: 31B Dense

Wenn es auf höchste Genauigkeit ankommt, ist das Modell 31B die erste Wahl. In unseren Tests war es das einzige Modell, das komplexe Logik und Abfragen präzise bewältigen konnte. Für forschungsintensive Aufgaben oder Schulungsszenarien sorgt diese dichte Architektur dafür, dass das gesamte „Wissen“ auf einmal verfügbar ist, anstatt in einzelne Bereiche unterteilt zu sein.

Hardware für den modernen Gründer

Sie brauchen keine leistungsstarke Hardware, um loszulegen. Zwar bietet ein M5 Max mit 128 GB RAM ein riesiges Kontextfenster, doch diese Modelle sind für Consumer-GPUs optimiert. Ein High-End-MacBook ist mittlerweile ein „Local-First“-KI-Server. Mit Tools wie MLX, OMLX und Open Web UI können Sie eine private, sichere KI-Schnittstelle erstellen, die vollständig auf Ihrem Schreibtisch läuft.

Warum „Local First“?

  1. Datenschutz: Ihre Daten verlassen zu keinem Zeitpunkt Ihren Computer.
  2. Geschwindigkeit: Nahezu null Latenz bei der Edge-Verarbeitung.
  3. Kosten: Sie müssen keine monatlichen Abonnements und keine Gebühren pro Token mehr bezahlen.
  4. Offline-Fähigkeit: Ihre KI funktioniert im Flugzeug, im Keller oder bei einem Netzwerkausfall.

Die Ära des „Mietens“ von Intelligenz neigt sich dem Ende zu. Es ist an der Zeit, eigene Modelle zu besitzen.

Transkript▾

Gemma ist eine Sammlung von Open-Source-KI-Modellen von Google. Die Modelle umfassen zwischen 2 Milliarden und 31 Milliarden Parameter und sind vor allem auf Verbraucherhardware ausgerichtet.

Ich verwende einen M5 Max mit 128 GB RAM, aber so viel braucht man nicht. Diese Modelle sind auf schwächere Hardware ausgelegt, auch wenn mehr RAM größere Kontextfenster ermöglicht.

Das Modell mit 2 Milliarden Parametern (2B) ist ein „denkendes“ Modell, allerdings sehr klein. Es eignet sich hervorragend für Mobiltelefone, Rechtschreibprüfung und Definitionen. Es ist blitzschnell, aber nicht besonders intelligent. Das 4B-Modell ist eine kleine Steigerung und dürfte der Standard für High-End-Smartphones sein.

Das „26B Mixture of Experts“ (MoE)-Modell stellt einen bedeutenden Fortschritt dar. Es nutzt gleichzeitig 4 Milliarden aktive Parameter, wodurch es schnell und effizient arbeitet. Es ist multimodal und eignet sich hervorragend für agentenbasierte Aufgaben, Arbeitsabläufe und das Programmieren.

Die Modelle 31B und 27B sind dichte Modelle. Im Gegensatz zu MoE sind alle Parameter gleichzeitig aktiv. Diese eignen sich besonders gut für Forschungszwecke, zum Trainieren und in Situationen, in denen hohe Intelligenz gegenüber Geschwindigkeit Vorrang hat.

Das Modell 12B schließt die Lücke zwischen den Mikro- und den Großmodellen und eignet sich daher ideal für MacBooks und professionelle Consumer-Hardware.

In unseren Tests hatten die Modelle 2B und 4B Schwierigkeiten mit bestimmten Detailfragen (Johto-Arenaleiter). Das Modell 12B lag näher an der richtigen Antwort, machte jedoch mehrere Fehler. Das Modell 31B war am genauesten, was belegt, dass für den praktischen Einsatz und reale Arbeitsabläufe größere Modelle erforderlich sind.

Um diese auszuführen, können Sie MLX für Mac oder LM Studio/Ollama für Nvidia-GPUs verwenden. Die Nutzung von Open Web UI über Docker bietet eine übersichtliche Oberfläche, um lokal mit diesen Modellen zu kommunizieren. Diese Konfiguration ermöglicht es Forschern und Entwicklern, ihre Workstations in „Local-First“-KI-Server zu verwandeln.