Ich habe die Zahlungen an ChatGPT eingestellt und mein eigenes KI-System entwickelt.

Ich habe mich in letzter Zeit intensiv mit dem lokalen Ausführen großer Sprachmodelle (LLMs) beschäftigt und nachdem ich alles gesehen habe Coole Dinge, die man mit MCP-Werkzeugen machen kannMir wurde klar, dass es an der Zeit war, meine eigenen Einstellungen ein wenig zu verbessern.

Ich habe die Zahlungen an ChatGPT eingestellt und mein eigenes KI-System entwickelt.

Anfangs war ich vom Hype um den DeepSeek R1 begeistert, aber seitdem sind viele neue Modelle auf den Markt gekommen. Angesichts der rasanten Veränderungen hielt ich es für sinnvoll, auch meinen Workflow zu optimieren.

LM Studio ist die beste lokale LLM-App, die ich (bisher) verwendet habe.

Ollama ist gut, aber das hier gefällt mir besser.

Meine ersten Experimente mit lokalen großen Sprachmodellen (LLMs) habe ich letztes Jahr mit Ollama durchgeführt.Es funktionierte zwar einigermaßen, aber mein armes MacBook Air mit nur 8 GB RAM war definitiv nicht für solche Aufgaben ausgelegt. Trotzdem wollte ich etwas anderes ausprobieren, teils aus Neugier, teils um zu sehen, ob ich noch mehr Leistung herausholen könnte.

Deshalb habe ich mich entschieden, LM Studio auszuprobieren. Mit dieser Anwendung lassen sich große Sprachmodelle (LLMs) lokal auf dem eigenen Rechner herunterladen und ausführen. Sie verfügt außerdem über eine übersichtliche Benutzeroberfläche. Da ich einen Mac nutze, war die MLX-Unterstützung für mich unerlässlich. Falls Sie MLX nicht kennen: Es handelt sich um Apples Framework für maschinelles Lernen, das speziell für Apple Silicon entwickelt wurde.

Im Wesentlichen ermöglicht es, Modelle mithilfe der Grafikprozessoreinheit (GPU) effizienter auszuführen. Um dies jedoch mit Zahlen zu untermauern, habe ich Ollama und LMStudio anhand desselben Modells direkt miteinander verglichen.

LM Studio vs. Ollama Token pro Sekunde

Mit LM Studio erreichte ich zwar eine höhere Symbolanzahl pro Sekunde, der Unterschied war aber so gering, dass er das Gesamterlebnis kaum beeinträchtigte. Trotzdem würde ich jede zusätzliche Leistung gerne nutzen.

Ich glaube jedoch nicht, dass es einen großen Unterschied macht, ob man sich für Ollama oder LM Studio entscheidet, insbesondere da beide auf ähnlichen grundlegenden Frameworks für die lokale Ausführung von Modellen basieren.

Mein Hauptkritikpunkt zu Beginn war die fehlende Multimedia-Unterstützung. Das ist aber mittlerweile kein Problem mehr. Sowohl Ollama als auch LM Studio unterstützen jetzt Multimedia-Vorlagen, und es gibt einige leistungsstarke Optionen, die Text und Bilder auf lokalen Geräten gut verarbeiten können.

Die Wahl des richtigen Modells kann etwas schwierig sein.

Es kann ein teures Hobby sein.

LM Studio Vorlagen-Suchliste

Bei der ersten Installation von LM Studio müssen Sie als Erstes eine Vorlage auswählen. Das mag für Anfänger etwas verwirrend sein, da es keine allgemeingültige Antwort wie „Verwenden Sie diese Vorlage“ gibt. Die richtige Wahl hängt von Ihrer Hardware ab.

Wenn Sie in LM Studio das Menü „Modellsuche“ öffnen, sehen Sie eine Liste der beliebtesten Modelle. Wie gefragt ein Modell ist, erkennen Sie ganz einfach an der Zahl direkt vor dem Buchstaben „B“ im Namen.

Das „B“ steht für Milliarden von Parametern. Generell gilt: Je höher diese Zahl, desto leistungsfähiger das Modell. Das bedeutet aber auch, dass es mehr Ressourcen benötigt. Auf einem Mac mit 8 GB VRAM halte ich 3 bis 4 Milliarden Parameter für einen guten Bereich. Auf einem PC kann die Sache etwas komplizierter sein. Hier ist anstelle des regulären Arbeitsspeichers (RAM) die Größe des verfügbaren Videospeichers (VRAM) entscheidend.

Mit 8 GB VRAM können Sie problemlos mit den Parametern der 7B-Grafikkarte experimentieren, insbesondere bei ressourcenschonenderen Quantenkonfigurationen. Meiner Erfahrung nach empfiehlt es sich, mit einem kleineren Modell zu beginnen und sich schrittweise heranzutasten, bis Sie die optimale Konfiguration gefunden haben.

Ich persönlich war eher vom Gemma 3 4B angetan, da es auf der gleichen Plattform wie Googles Gemini-Modelle basiert. Ich würde Ihnen aber trotzdem empfehlen, auch die Qwen-Modelle auszuprobieren. Je nachdem, wofür Sie sie verwenden, könnten sie besser geeignet sein.

Sie können sogar die Websuche in Ihr lokales LLM-Programm integrieren.

DuckDuckGo eilt zur Hilfe.

DuckDuckGo-Add-on-Seite in LM Studio

Einer der häufigsten Kritikpunkte an nativen großen Sprachmodellen (LLMs) ist ihre eingeschränkte Funktionalität im Vergleich zu cloudbasierten Modellen wie ChatGPT bei der Websuche. Es ist wenig hilfreich, nach dem neuesten iPhone zu fragen und dann vom iPhone 14 zu hören. Hier haben sich cloudbasierte Modelle als überlegen erwiesen.

LM Studio verfügt über ein integriertes Plugin-System, und das Hinzufügen einer Websuche ist denkbar einfach. Gehen Sie einfach zu DuckDuckGo-Add-on-SeiteUnd geben Sie „In LM Studio ausführen“ an.

Sobald diese Funktion aktiviert ist, erscheint beim Ausfüllen eines Formulars unterhalb des Chatfensters eine Option, mit der Sie gefragt werden, ob Sie DuckDuckGo für Ihre Suchanfrage verwenden möchten. Wenn Sie diese Option aktivieren, ruft LM Studio Live-Suchergebnisse ab und fügt sie dem Formular hinzu, bevor eine Antwort generiert wird.

LM Studio durchsucht das Web über DuckDuckGo.

Das ist noch nicht alles, was man mit Plugins machen kann. Das LM Studio-Team hat auch einige sehr nützliche Plugins entwickelt. Zum Beispiel gibt es ein Wikipedia-Plugin, mit dem Ihr großes Sprachmodell Artikel aus Wikipedia lesen und durchsuchen kann (selbstverständlich).

Es gibt auch das JavaScript-Sandbox-Plugin, das sehr nützlich sein kann, wenn man sich für Vibe-Coding interessiert und schnell eine grobe Vorstellung davon bekommen möchte, was man entwickeln will. Ich würde aber nicht sagen, dass sich der Aufwand lohnt, um etwas Produktionsreifes zu erstellen.

Weg mit den großen Firmen!

Sie können LM Studio so einrichten, dass Sie von Ihrem Telefon aus auf Ihr großes Sprachmodell zugreifen können. Wenn Sie aber die gesamte Inferenz direkt auf Ihr Telefon übertragen möchten, ist das auch möglich. Ausführen kleinerer und größerer Sprachmodelle auf einem Android-TelefonAuch wenn es nicht so leistungsstark sein wird wie das, was Sie auf einem Mac bekommen.

Die Weiterentwicklung dieser leichten Modelle schreitet rasant und beeindruckend voran. Angesichts der voraussichtlich steigenden Hardwarekosten würde es mich nicht wundern, wenn Unternehmen wie OpenAI oder Google ihre Abonnementpreise erhöhen würden. Umso beruhigender ist es, ein System zu haben, das davon unberührt bleibt.

Nach oben gehen