More AI komplett offline nutzen mit lokalen Modellen (Ollama & LM Studio)

Richte More AI auf ein Modell, das auf deiner eigenen Hardware läuft, und nichts verlässt je deinen Rechner — keine API-Rechnung, kein Internet nötig. Hier erfährst du, wie du Ollama oder LM Studio in Minuten einrichtest und was du von lokalen Modellen in jedem Modus erwarten kannst.

Das More-AI-Team · Aktualisiert am 16. Juli 2026

Warum ein Modell lokal laufen lassen

Jedes Cloud-Modell — auch über deinen eigenen API-Schlüssel — bedeutet, dass dein Prompt zu irgendjemandes Server reist. Ein lokales Modell entfernt diesen letzten Hop: Das Modell läuft auf deiner eigenen Hardware, More AI spricht über localhost mit ihm, und deine Unterhaltungen berühren das Netzwerk überhaupt nicht. Das ist das Setup für sensible Dokumente, abgeschottete Rechner oder einfach die Arbeit im Flugzeug.

Der zweite Grund sind die Kosten: Ein lokales Modell hat keinen Preis pro Token. Stell ihm tausend Fragen, und die Rechnung ist dein Strom. Der ehrliche Kompromiss ist die Leistungsfähigkeit — lokale Modelle sind kleiner als Frontier-Modelle aus der Cloud, also heb dir die harten Denkaufgaben für einen Cloud-Schlüssel auf und lass das lokale Modell die Alltagsarbeit tragen.

Ollama: der schnellste Weg

Installiere Ollama, lade ein Modell mit einem einzigen Befehl (zum Beispiel einen Llama-, Qwen- oder Gemma-Build passend zu deinem RAM), und es serviert das Modell lokal. In More AI öffnest du Einstellungen → Anbieter und aktivierst Ollama — kein API-Schlüssel, keine Konfiguration. Die App erkennt deine installierten Modelle automatisch, und sie erscheinen im Modell-Picker neben deinen Cloud-Modellen.

Ab da verhält es sich wie jeder andere Anbieter: Wähl das lokale Modell für eine Unterhaltung und leg los. Die Kontextfenster-Anzeige und der Modellwechsel pro Unterhaltung funktionieren genauso.

LM Studio: ein freundlicher Modell-Manager

Lieber eine grafische App? Mit LM Studio durchstöberst du offene Modelle und lädst sie herunter, dann serviert es sie mit einem Klick von einem lokalen Server. More AI unterstützt es als erstklassigen Anbieter, genau wie Ollama: Aktiviere es unter Einstellungen → Anbieter, und deine heruntergeladenen Modelle tauchen im Picker auf.

Jeder andere Server: eigene Endpunkte

Du betreibst vLLM, llama.cpp oder einen LiteLLM-Proxy? Füge einen eigenen Anbieter hinzu und richte ihn auf jeden Endpunkt, der die OpenAI-kompatible Chat-Completions-API spricht (die Basis-URL endet meist auf /v1) — oder auf einen Anthropic-kompatiblen Messages-Endpunkt. Das deckt praktisch jeden selbst gehosteten Modellserver ab, auf deinem Rechner oder auf einer Kiste in deinem LAN.

Der Modell-Picker mit lokalen Modellen neben Cloud-Anbietern

Lokal und Cloud mischen

Du musst dich nicht ein für alle Mal entscheiden. Schlüssel und lokale Anbieter leben Seite an Seite, und jede Unterhaltung wählt ihr eigenes Modell — ein praktisches Setup ist also ein lokales Modell für private Notizen und schnelle Fragen und ein Frontier-Modell für die Aufgaben, die es verdienen. Der Wechsel sind zwei Klicks, keine Neukonfiguration.

Alle drei Modi funktionieren mit lokalen Modellen — Chat, Cowork und Code laufen durch dieselbe Engine. Nimm für die Agenten-Modi das leistungsfähigste lokale Modell, das deine Hardware stemmt: Planung und Tool-Nutzung belohnen ein stärkeres Modell.

Häufige Fragen

Ist ein lokales Modell wirklich kostenlos?

Es gibt keine Kosten pro Token — das Modell läuft auf deiner eigenen Hardware, die einzigen Kosten sind also der Strom, den dein Computer verbraucht. Die More-AI-App selbst ist ebenfalls kostenlos.

Funktioniert alles offline?

Chat, Cowork und Code funktionieren mit einem lokalen Modell vollständig offline — Dateien, Dokumente und Repositories liegen ohnehin auf deiner Festplatte. Nur Funktionen, die von Natur aus Internet brauchen (Websuche, Synchronisierung, Connectors), warten, bis du wieder online bist.

Welche Hardware brauche ich?

Ein kleines Modell läuft bequem in 8–16 GB RAM; größere, leistungsfähigere Modelle wollen mehr Speicher oder eine GPU. Macs mit Apple Silicon sind besonders gute Gastgeber. Fang klein an, schau, was dein Rechner schafft, und geh dann eine Nummer größer.

Welche lokalen Server unterstützt More AI?

Ollama und LM Studio sind eingebaut — kein Schlüssel, keine Einrichtung über das Aktivieren hinaus. Darüber hinaus funktioniert jeder OpenAI-kompatible Endpunkt (vLLM, llama.cpp, LiteLLM) oder Anthropic-kompatible Endpunkt als eigener Anbieter.

Kann der Coding-Agent ein lokales Modell nutzen?

Ja — der Code-Modus läuft durch dieselbe Engine, ein lokales Modell kann also auch planen und bearbeiten. Agenten-Arbeit belohnt stärkere Modelle: Nimm das leistungsfähigste lokale Modell, das deine Hardware stemmt, oder wechsle für diese eine Session auf einen Cloud-Schlüssel.

Alle Guides