Über dieses Video
Ihre High-End-GPU ist für alltägliche KI-Aufgaben wahrscheinlich reine Geldverschwendung. In diesem Video teste ich die Grenzen des MacBook Neo aus, um zu sehen, ob es lokale LLMs wie Gemma 4 bewältigen kann. Das Wichtigste auf einen Blick: - OMLX ist eine hervorragende, ressourcenschonende Alternative zu LM Studio für ältere Macs oder Macs mit Basismodellen. - Ein Modell mit 2 Milliarden Parametern läuft mit beachtlichen 24 Tokens pro Sekunde auf nur 8 GB RAM. - Lokale KI eignet sich hervorragend für allgemeine Chats und einfache Aufgaben, hat jedoch noch Schwierigkeiten mit komplexer Logik wie beispielsweise bei der Spieleentwicklung. - Hugging Face bleibt die erste Anlaufstelle für die Suche nach quantisierten MLX-Modellen.
Die Ära der „Monster-KI-Rigs“ ist für den durchschnittlichen Entwickler offiziell vorbei.
In der Tech-Welt herrscht häufig das Missverständnis, dass man einen flüssigkeitsgekühlten Multi-GPU-Koloss benötigt, um lokale künstliche Intelligenz zu betreiben. Ich habe mich kürzlich daran gemacht, dieses Vorurteil zu widerlegen, indem ich das MacBook Neo getestet habe: ein Gerät, das viele als bloßes Spielzeug für Endverbraucher abtun würden.
Der minimalistische Ansatz in der KI
Mein Ziel war einfach: die absolut minimale Hardware zu finden, die erforderlich ist, um lokale LLMs (Large Language Models) auszuführen, ohne dass die Erfahrung dabei zu einer totalen Katastrophe wird. Auch wenn wir nicht vorhaben, das nächste GPT-4 zu trainieren oder riesige Codebasen zu verarbeiten, gibt es ein wachsendes Ökosystem von Modellen wie Gemma 4 und Qwen 3.5, die speziell für den lokalen Einsatz entwickelt wurden.
Die Werkzeuge: Warum OMLX überzeugt
Wenn Sie einen Mac nutzen, haben Sie wahrscheinlich schon von LM Studio gehört. Für diejenigen unter uns, die die Grenzen der Hardware von Basismodellen ausreizen, wirkt LM Studio jedoch langsam etwas überladen. Ich habe mich für OMLX entschieden, eine schlanke Alternative, mit der wir MLX-optimierte Modelle mit deutlich geringerem Overhead ausführen können.
Die Einrichtung ist ganz einfach:
- Laden Sie die OMLX-Version herunter (ich habe aus Stabilitätsgründen Version 3.6 verwendet).
- Besuchen Sie Hugging Face, um quantisierte Modelle zu finden.
- Verwenden Sie das OMLX-Admin-Panel, um das Modell herunterzuladen und lokal bereitzustellen.
Realitätscheck zur Leistung
Ich habe eine Version von Gemma 4 mit 2 Milliarden Parametern getestet, die vom Team bei Onslaught auf 4 Bit quantisiert wurde. Auf einem Rechner mit nur 8 GB RAM waren die Ergebnisse überraschend brauchbar:
- Geschwindigkeit der automatischen Vervollständigung: Bei kurzen Eingabeaufforderungen nahezu sofort.
- Erzeugungsgeschwindigkeit: Etwa 24 Token pro Sekunde.
- Wärmemanagement: Der Laptop blieb angenehm kühl.
Der „Snake“-Test
Um das Kontextfenster weiter voranzutreiben, bat ich das Modell, ein funktionsfähiges HTML5-„Snake“-Spiel zu generieren. Es erzeugte den Code zwar fast augenblicklich, doch die Logik war fehlerhaft: Die Schlange war zwar vorhanden, das Futter jedoch nicht. Selbst nach einer weiteren Aufforderung, den Code zu korrigieren, hatte das Modell Schwierigkeiten mit der komplexen Logik, die für ein voll funktionsfähiges Spiel erforderlich ist.
Fazit
Kann man auf einem MacBook Neo lokale KI ausführen? Ja.
Ist es ein Ersatz für eine High-End-Workstation? Nein.
Für anspruchsvolle Google-Suchen, allgemeine Chats und einfaches kreatives Schreiben sind diese kleinen Modelle auf bescheidener Hardware mehr als ausreichend. Es ist an der Zeit, sich keine Gedanken mehr über Ihren VRAM zu machen und stattdessen damit zu experimentieren, was Sie bereits besitzen.
Transkript▾
In meinem unermüdlichen Bestreben herauszufinden, welche Mindesthardware wir für die Ausführung lokaler AR-Modelle benötigen, habe ich mir kürzlich das MacBook Neo zugelegt. Lasst uns aber gleich zu Beginn die Erwartungen klarstellen: Wir werden keine der größten Modelle ausführen. Wir werden keine Modelle mit riesiger Kontextgröße ausführen und auch keinerlei Programmierarbeiten auf diesem Gerät vornehmen. [Gelächter] Aber was können wir mit all diesen Modellen, die wir bekommen können – wie Gemma 4 und Qwen 3.5, die für die Ausführung auf lokaler Hardware einschließlich Smartphones gedacht sind – auf diesem Gerät zum Laufen bringen? Ich habe buchstäblich noch nichts heruntergeladen. Wir werden also alles einrichten, und ihr werdet ein wenig darüber lernen, wie man die Dinge einrichtet, unabhängig davon, welches MacBook ihr nutzt.
Aber sobald wir es heruntergeladen haben, schauen wir mal, was wir damit alles anstellen können. Ich habe es ursprünglich gekauft, um eine lokale KI-Server-Konfiguration zu testen, auf die ich verlinken werde, sobald sie veröffentlicht ist. Falls nicht, abonniert den Kanal dafür. Also, ohne weitere Umschweife: Lasst uns einfach loslegen. Ich zeige euch, wie man alles einrichtet, und dann geht’s richtig los.
Also gut, das Wichtigste zuerst: Auf Macs solltet ihr OMLX herunterladen. Damit können wir MLX-Modelle auf MacBooks ausführen. Das geht auch mit LM Studio. Ich persönlich bevorzuge jedoch mittlerweile die schlankere Version von OMLX, und es gibt Berichte, dass sie sogar schneller ist als LM Studio. LM Studio wird einfach langsam etwas aufgebläht. Damit steht uns also Version 3.6 zur Verfügung. Nun gab es einen Release-Kandidaten für Version 3.7, der aber anscheinend wieder entfernt wurde. Oh, wir haben auch einen Release-Kandidaten. Bleiben wir bei Version 3.6. Scrollen wir nach unten. Wir sind bei „Tahoe“, also laden wir das einfach herunter.
Während das nun ebenfalls heruntergeladen wird, solltet ihr zu Hugging Face gehen – einem Repository, das ähnlich wie GitHub funktioniert, da dort lokale Modelle gespeichert werden, die ihr herunterladen könnt. Und Gemma 4 – seien wir ehrlich: Gemma 4 wird das Modell sein, das wir hier herunterladen können, denn dort gibt es, glaube ich, ein Modell mit 3 oder 2 Milliarden Parametern. Also geben wir „MLX“ ein. Nehmen wir 2 Milliarden. Ja, hier haben wir also ein Modell mit 2 Milliarden Parametern. Das ist 4,5 Gigabyte groß, was meiner Meinung nach ausreicht, um darauf Platz zu finden. Ich weiß es ehrlich gesagt nicht.
Wir werden das hier kopieren, wodurch „Onslaught Gemma 4“ kopiert wird. Onslaught ist das Unternehmen, das das Modell quantisiert und in das MLX-Format konvertiert hat. Und dann machen wir uns an die Einrichtung. Wenn ihr möchtet, dass die Daten in bestimmten Verzeichnissen gespeichert werden, könnt ihr das alles einrichten. Wir werden auf Port 8000 laufen. Dann richten wir hier einen API-Schlüssel ein und können den Server starten.
Wenn wir nun das Admin-Panel öffnen und unseren API-Schlüssel eingeben, gelangen wir zum Dashboard. Dieses läuft hauptsächlich im Browser. Der Zugriff auf alles erfolgt über den Browser, und wir gelangen zu den Modellen und zum Downloader. Hier fügen wir die Hugging-Face-URL ein, die wir kopiert haben. Wir können das Modell nun herunterladen. Wenn Sie hier zu unserem Manager gehen und die Seite aktualisieren, sehen wir, wie unser Modell heruntergeladen wird.
Und auch hier werden wir uns wieder auf den Chat beschränken. Wie ihr wisst, funktioniert das Programmieren bei diesen Modellen im Allgemeinen einfach nicht gut. Vielleicht schaffen wir es ja, etwas zum Laufen zu bringen. Vielleicht können wir das Modell dazu bringen, eine Datei zu lesen, aber bei jeder Art von Codebasis wird es schon beim Lesen von mehr als ein paar Dateien ins Stocken geraten. Vielleicht schaffen wir es, eine HTML-Datei zu generieren. Lasst uns das doch tatsächlich mal versuchen.
Und dann gehen wir mal rüber zum Chat hier. Wir können sagen: „Erzähl mir eine Geschichte mit tausend Wörtern.“ Und wir arbeiten hier fleißig weiter. Es läuft wie geschmiert. Wir stoßen schon fast an die 8-Gigabyte-Grenze. Ich wusste ehrlich gesagt gar nicht, wie viel RAM wir in diesem Gerät haben, aber offensichtlich sind es 8 Gigabyte. Ich meine, die Maus ruckelt nicht. Sie schreibt. Wenn wir hier nach oben scrollen, sehen wir einige Statistiken und können erkennen, wie lange die einzelnen Vorgänge dauern.
Es läuft zwar noch ein bisschen ruckelig, das gebe ich zu, aber wir fangen mal an – wir sehen schon, dass hier einige Logs durchkommen. Das hat also 71 Sekunden gedauert. Vorabfüllung mit insgesamt zwei Tokens pro Sekunde. 24 Tokens pro Sekunde. Gar nicht so schlecht. Mal sehen, ob wir eine HTML-Datei generieren können. Erstellen wir eine einfache HTML-Seite mit einem Snake-Spiel im Old-School-Stil. Und das hat tatsächlich nur sehr wenig Zeit gebraucht, um zu starten. Es ging so gut wie sofort los. Das habt ihr dort gesehen. Ich meine, die Wärmeentwicklung ist überhaupt nicht schlimm. Es ist fast nichts. Es ist kaum spürbar, also nicht wirklich unangenehm.
Und wenn man ein paar Modifikationen daran vornehmen würde – was ich online gesehen habe –, könnte man wahrscheinlich eine ordentliche Leistung aus dem Ding herausholen. Okay, fertig. Kopieren wir das mal. Okay. Wow, das geht aber schnell. Spiel starten. Okay. Ich meine, ich habe zwar eine Schlange, aber ich habe nichts zu essen. Wie wäre es also, wenn wir das weiterverfolgen, diesen Kontext vertiefen und sagen: „Funktioniert super, aber ich habe nichts zu essen.“ Punkte sammeln. Wachsen.
Wie diese Folgemaßnahmen, die nun wirklich sichtbar werden, zeigen: Die Vorabausfüllung erfolgt vielleicht früher, aber wir ergänzen diesen Kontext lediglich. Wir bauen diesen Kontext auf – das geht zwar nur schleppend voran, aber wir sind auf dem richtigen Weg. Oh, da hast du absolut Recht. Das hatten wir schon einmal. Hier ist der korrekte HTML- und JavaScript-Code. Ich hätte mir ehrlich gesagt wahrscheinlich einfach den JavaScript-Code geben lassen sollen. Der eigentliche HTML-Code ist größtenteils derselbe, aber ich würde gerne wissen, um welche Art von Kontext es hier genau geht.
Los geht’s. Da sind die standardmäßigen 32.000. Es läuft noch. Okay. Also, wir haben das Problem anscheinend behoben. Okay, wir sehen immer noch nichts, womit wir Punkte sammeln könnten. Spiel initialisiert. Spiel gestartet. Kein Essen. Okay, na ja, ich meine, was kann man da schon wirklich erwarten? Aber Gemma 4 funktioniert. Ich denke, das reicht für etwas aufgemotzte Google-Suchen, allgemeines Chatten und dergleichen – also genau das, was man von Modellen mit 2 Milliarden oder 4 Milliarden Parametern erwarten würde, zumal es auf 4 Bit quantisiert wurde. Aber das beantwortet die Frage: Können wir lokale KI auf einem MacBook Neo ausführen? Die Antwort lautet: Ja, das können wir, aber man sollte seine Erwartungen entsprechend anpassen.