Guide zum Short · Claude Code lokal · Okt 2026
Claude Code auf deinem Rechner, ohne API-Rechnung.
Seit Version 0.14 versteht Ollama dieselbe Sprache wie die Anthropic API. Claude Code kann also mit einem Open-Source-Modell auf deinem eigenen Rechner laufen: kein Limit, keine Rechnung, deine Daten bleiben bei dir. Hier sind die Befehle, beide Einstellungen und welches Modell zu deinem Rechner passt.
Der Guide · zum Umsetzen
Alles aus dem Video, kurz zum Nachmachen.
- 01
Einmal im Terminal
Schritt 1: Ollama und Claude Code installieren
Auf dem Mac oder unter Linux reicht je ein Befehl. Für Windows gibt es auf ollama.com/download und in der Claude-Code-Doku eigene Befehle für die PowerShell.
# Ollama installieren curl -fsSL https://ollama.com/install.sh | sh # Claude Code installieren curl -fsSL https://claude.ai/install.sh | bash # Version prüfen (Ollama muss mindestens 0.14 sein) ollama --version - 02
Qwen oder GLM
Schritt 2: Ein Modell herunterladen
Lad dir eins der Modelle runter. Welches zu deinem Rechner passt, steht weiter unten.
# Qwen, klein und flexibel (Standardgröße 9b) ollama pull qwen3.5 # Qwen, speziell zum Programmieren ollama pull qwen3-coder # GLM, die lokale Flash-Version ollama pull glm-4.7-flash - 03
Claude Code auf Ollama umstellen
Schritt 3: Die zwei Einstellungen
Der einfachste Weg ist ein einziger Befehl, Ollama richtet dann alles selbst ein. Wenn du es von Hand machen willst, sind es zwei Einstellungen: die Adresse zeigt auf deinen Rechner statt auf Anthropic, und der Token sagt „ollama“. Den leeren API-Key setzt die Ollama-Doku zusätzlich, damit kein alter Key dazwischenfunkt.
# Weg A: automatisch ollama launch claude # Weg B: von Hand export ANTHROPIC_BASE_URL=http://localhost:11434 export ANTHROPIC_AUTH_TOKEN=ollama export ANTHROPIC_API_KEY="" claude --model qwen3.5 # Für Coding empfiehlt Ollama mindestens 64.000 Tokens Kontext OLLAMA_CONTEXT_LENGTH=64000 ollama serveIn Claude Code zeigt dir der Befehl /status, ob die Verbindung zu Ollama steht.
- 04
Größen laut Ollama
Welches Modell zu deinem Rechner passt
Das Modell muss komplett in deinen Arbeitsspeicher passen (beim Mac der gemeinsame Speicher, sonst die Grafikkarte), plus Platz für den Kontext. Diese Downloadgrößen nennt Ollama auf den Modellseiten:
- qwen3.5:4b: 3,3 bis 4,0 GB. Für kleine Rechner und erste Tests.
- qwen3.5 (9b, Standard): 6,6 bis 7,6 GB. Der Mittelweg.
- qwen3.5:27b: 17 bis 20 GB. Für Rechner mit viel Speicher.
- qwen3-coder (30b): 19 GB. Zum Programmieren.
- glm-4.7-flash: 19 GB. Laut Ollama brauchst du mit 64.000 Tokens Kontext etwa 23 GB Grafikspeicher.
Faustregel: Downloadgröße plus ein paar GB Puffer. Wenn alles zäh wird, nimm die nächstkleinere Größe. Modelle mit „:cloud“ im Namen laufen nicht lokal, sondern auf Ollamas Servern.
- 05
Wofür es reicht
Ehrlich gesagt: die Grenzen
An Opus kommt so ein lokales Modell nicht ran. Für kleine Aufgaben, Ordner aufräumen oder erste Entwürfe reicht es locker, und dein Claude-Limit hebst du dir für die schweren Sachen auf.
- Gut: Dateien umbenennen und sortieren, kleine Skripte, Texte zusammenfassen, erste Entwürfe.
- Schwierig: große Projekte, lange Planungen, Aufgaben mit vielen Schritten.
- Je kleiner das Modell, desto öfter musst du nachbessern.
Das Video dazu
Im Video zeige ich dir alles einmal live. Schau es dir an, wenn du einen Schritt genauer sehen willst.
KI Agenten Club
Lokal für die kleinen Sachen, Claude für die schweren: im KI Agenten Club zeige ich dir, wie ich Modelle je nach Aufgabe einsetze und mein ganzes Setup dahinter.
KI Agenten Club
Vom Guide zum kompletten Setup.
Richtig Zeit sparst du, wenn Skills, Agenten, MCP-Server und deine CLAUDE.md zusammenspielen. Im KI Agenten Club zeigen wir dir das an unserem eigenen Setup, damit du es für deine Arbeit nachbauen kannst.
Vishal Punia · KI Agenten Club
Setup zum Übernehmen
Die Skills, MCP-Server und Vorlagen aus unserem Alltag, bald auch Orbit. Monatlich oder jährlich, direkt in Skool.