Zum Hauptinhalt springen
22. April 202614:28

MLX vs. GGUF: Der ultimative Vergleich

Von Samuel Gregory

Über dieses Video

Ihr teures MacBook wird durch veraltete Modellformate ausgebremst. In diesem Video gehe ich anhand des brandneuen M5 MacBook Pro ausführlich auf die Leistungsunterschiede zwischen GGUF und MLX ein. Wir testen Qwen 3.6 bei Programmieraufgaben und kreativem Schreiben, um herauszufinden, welches Format auf Apple Silicon tatsächlich die Nase vorn hat. Die wichtigsten Erkenntnisse: - MLX übertrifft GGUF bei kontextintensiven Aufgaben wie dem Programmieren deutlich. - GGUF mit großen Kontextfenstern kann selbst auf moderner M5-Hardware noch zum Einfrieren des Systems führen. - OMLX ist eine überlegene, ressourcenschonende Alternative zu LM Studio für Mac-Nutzer. - Das Kontext-Caching in MLX ermöglicht nahezu sofortige Antworten, selbst wenn Ihr Chat-Verlauf immer länger wird. - Für lokale LLMs auf dem Mac sind 32 GB RAM das absolute Minimum für ein flüssiges Erlebnis.

Verschwenden Sie das Potenzial Ihres Macs nicht länger mit suboptimalen Dateiformaten

Wenn Sie immer noch GGUF-Modelle auf Ihrer Apple-Silicon-Hardware ausführen, fahren Sie im Grunde genommen einen Ferrari im ersten Gang. Die lokale LLM-Landschaft verändert sich rasant, und meine jüngsten Tests auf dem M5 MacBook Pro belegen, dass der herkömmliche Llama.cpp-Ansatz Sie möglicherweise daran hindert, die volle Leistung auszuschöpfen, zu der Ihr Gerät fähig ist.

Der MLX-Vorteil

Bei meinem jüngsten Vergleich zwischen den GGUF- (unter Nutzung von TurboQuant) und MLX-Versionen von Qwen 3.6 waren die Ergebnisse nicht nur geringfügig unterschiedlich, sondern geradezu bahnbrechend. MLX, Apples proprietäres Framework, wurde von Grund auf dafür entwickelt, die Vorteile des einheitlichen Speichers voll auszuschöpfen. GGUF ist zwar der Industriestandard für plattformübergreifende Kompatibilität, doch fehlt ihm die Präzision, die MLX für Mac-Nutzer bietet.

Das M5 MacBook Pro im Test

Das MacBook Pro M5 in der Basisausstattung mit 32 GB RAM ist ein wahres Kraftpaket, doch bei der Verarbeitung großer Kontextfenster mit GGUF stieß es an seine Grenzen. Ich habe versucht, ein Kontextfenster mit 64.000 Einträgen auszuführen, woraufhin das System komplett einfror. Diese „Kontextangst“ stellt für Entwickler eine echte Hürde dar. Beim Wechsel zu OMLX, einer schlanken Anwendung zur Ausführung von MLX-Modellen, war der Unterschied in der Effizienz jedoch wie Tag und Nacht.

Wichtigste Leistungsergebnisse:

  1. Geschwindigkeit: MLX erzielte durchweg höhere Werte bei den Token pro Sekunde und erreichte über 31 t/s, während die Werte bei GGUF zwischen 20 und 26 t/s schwankten.
  2. Caching: Die wahre Magie entfaltet sich bei Programmieraufgaben. MLX bewältigte einen Kontext mit 39.000 Token mühelos, während GGUF fast eine Stunde benötigte, um einen kleineren Kontext mit 25.000 Token zu verarbeiten.
  3. Speicherverwaltung: MLX schont den Arbeitsspeicher deutlich stärker, was ein flüssigeres Multitasking ermöglicht, selbst wenn das Modell stark ausgelastet ist.

Warum Sie wechseln sollten

Während TurboQuant derzeit auf MLX portiert wird, ist OMLX bereits jetzt die bessere Wahl für alle, denen Geschwindigkeit und Kontext besonders wichtig sind. Wenn Sie Tools wie Kilo Code oder General Chat nutzen, ist die Integration eines OMLX-Backends über einen benutzerdefinierten Provider ein unkomplizierter Vorgang, der sich sofort auszahlt.

Lassen Sie Ihre Hardware nicht ungenutzt. Bei lokaler KI geht es um Datenschutz und Leistung, und auf einem Mac ist MLX die einzige Lösung.

Hat Ihnen diese Analyse gefallen? Abonnieren Sie unseren Newsletter, um weitere ausführliche Einblicke in die M5 MacBook Pro-Serie zu erhalten.

Stichwörter

KIMacBookLokale KI