Künstliche Intelligenz · Praxisleitfaden
Lokale KI-Agenten: So nutzt du sie auf deinem eigenen Rechner
Was „lokal“ wirklich bedeutet, welchen Rechner du brauchst, welche Programme und Modelle sich eignen und wann es sich gegenüber ChatGPT oder Claude lohnt. Ohne deine Daten an irgendjemanden zu schicken.
Von Dravvt · September 2026 · 9 Min. Lesezeit

Jedes Mal, wenn du ChatGPT oder Claude nutzt, landet das, was du schreibst, auf den Servern eines anderen Unternehmens. Oft spielt das keine Rolle, doch beim Code eines Kunden, bei Arbeitsdokumenten oder persönlichen Daten sieht die Sache anders aus. Die Alternative ist, den Agenten auf deinem eigenen Rechner zu betreiben, mit Modell, Tools und Daten unter deiner Kontrolle.
2026 ist das mit einem Rechner der oberen Mittelklasse bereits machbar. In diesem Artikel erkläre ich, was „lokal“ genau bedeutet – das ist weniger offensichtlich, als es scheint –, welche Hardware du brauchst, welche Programme du nutzen solltest, welche Modelle sich gut als Agenten eignen und wann sich das gegenüber der Cloud lohnt.
Was „lokaler Agent“ bedeutet (und was nicht)
Ein Agent besteht aus zwei Teilen: dem Modell, das denkt, und dem Agentenprogramm, das den Kreislauf aus Nachdenken, Tool-Einsatz und Überprüfen des Ergebnisses ausführt. Falls dir das neu ist, erkläre ich es in meinem Artikel über KI-Agenten. Damit ein Agent wirklich lokal ist, müssen beide Teile auf deinem Rechner laufen.
Hier lauert eine Falle. Viele Agenten-Tools werden zwar auf deinem Rechner installiert, schicken aber jede Anfrage an ein Modell in der Cloud. Selbst Ollama, das beliebteste Programm, um Modelle lokal auszuführen, bietet inzwischen Modelle an, die in der eigenen Cloud des Anbieters laufen (Ollama, n.d.-a). Läuft das Modell dagegen tatsächlich auf deinem Rechner, ist die Dokumentation eindeutig: Das Unternehmen sieht weder deine Eingaben noch deine Daten (Ollama, n.d.-c). Wenn du sichergehen willst, dass nichts deinen Rechner verlässt, kannst du den Cloud-Teil mit der Variable OLLAMA_NO_CLOUD=1 abschalten (Ollama, n.d.-c).
Welchen Rechner du brauchst
Entscheidend ist der Speicher: Das komplette Modell muss in den Speicher der Grafikkarte (VRAM) passen oder, langsamer, in den Arbeitsspeicher des Systems. LM Studio, eines der meistgenutzten Programme, empfiehlt mindestens 16 GB RAM und unter Windows und Linux mindestens 4 GB dedizierten Grafikspeicher; auf dem Mac setzt es einen Apple-Silicon-Prozessor voraus (LM Studio, n.d.-a).
Zur Orientierung: So viel Speicher gibt Google allein für das Laden der Gewichte seiner offenen Gemma-4-Modelle an (Google, 2026a). „Q4“ bedeutet auf 4 Bit komprimiert, die übliche Art, sie auf einem Heimrechner zu nutzen:
| Modell | Unkomprimiert (BF16) | Komprimiert (Q4) |
|---|---|---|
| Gemma 4 E2B | 11,4 GB | 2,9 GB |
| Gemma 4 E4B | 17,9 GB | 4,5 GB |
| Gemma 4 12B | 26,7 GB | 6,7 GB |
| Gemma 4 26B A4B | 57,7 GB | 14,4 GB |
| Gemma 4 31B | 69,9 GB | 17,5 GB |
Zwei Details solltest du im Blick behalten. Erstens beziehen sich diese Zahlen nur auf das Modell: Google weist darauf hin, dass der zusätzliche Speicher für die Software und den Kontext nicht enthalten ist, also für den Text, den das Modell während der Arbeit präsent hält (Google, 2026a). Zweitens sind bei MoE-Modellen wie dem 26B A4B zwar nur etwa 4 Milliarden Parameter gleichzeitig aktiv, in den Speicher geladen werden müssen aber alle 26 Milliarden (Google, 2026a).
Und ohne Grafikkarte? Auch das geht: llama.cpp läuft allein auf dem Prozessor oder verteilt die Arbeit zwischen Prozessor und Grafikkarte (ggml-org, n.d.-a). Das ist langsamer, funktioniert aber.
Der häufigste Fehler: zu wenig Kontext
Agenten brauchen viel Kontext, weil sie laufend ansammeln, was sie lesen, welche Tools sie nutzen und welche Ergebnisse sie erhalten. Ollama richtet den Kontext nach dem verfügbaren Grafikspeicher aus: Bei weniger als 24 GB vergibt es standardmäßig nur 4.000 Tokens, obwohl es für Agenten und Programmier-Tools mindestens 64.000 empfiehlt (Ollama, n.d.-b).
Wenn dein lokaler Agent seine Tools ignoriert oder mitten in einer Aufgabe den Faden verliert, solltest du das als Erstes prüfen. Um den Kontext zu vergrößern, reicht es, Ollama mit OLLAMA_CONTEXT_LENGTH=64000 ollama serve zu starten (Ollama, n.d.-b).
Programme, um das Modell auszuführen
- Ollama: die einfachste Lösung. Es ist kostenlos, Open Source (MIT-Lizenz) und für Mac, Windows und Linux verfügbar. Du lädst ein Modell mit einem einzigen Befehl herunter, und schon ist es auf deinem Rechner einsatzbereit (Ollama, n.d.-e). Das Modell kann Tools nutzen, sogar mehrere gleichzeitig, und komplette Agentenschleifen ausführen (Ollama, n.d.-d).
- llama.cpp: die Engine, die unter der Haube vieler dieser Programme arbeitet. Sie ist technischer, bietet dafür aber die meiste Kontrolle. Sie läuft auf dem Prozessor und auf fast jeder Grafikkarte und unterstützt ebenfalls Tools (ggml-org, n.d.-a, n.d.-b).
- LM Studio: die Variante mit grafischer Oberfläche, ganz ohne Terminal. Modelle, die Tools nativ beherrschen, markiert es mit einem Hammersymbol (LM Studio, n.d.-b).
Alle drei bieten eine OpenAI-kompatible Schnittstelle, sodass viele Programme, die für ChatGPT gedacht sind, mit deinem lokalen Modell arbeiten können; dafür änderst du nur die Serveradresse (LM Studio, n.d.-b; OpenCode, n.d.).
Agentenprogramme, die mit lokalen Modellen funktionieren
- Programmieragenten: Ollama lässt sich über den Befehl
ollama launchdirekt mit Claude Code, Codex, OpenCode und anderen Tools verbinden (Ollama, n.d.-e). Das quelloffene OpenCode funktioniert mit Ollama, LM Studio oder llama.cpp (OpenCode, n.d.). Die meistgenutzten Programmieragenten vergleiche ich in Claude Code vs. Codex vs. Cursor. - Eigene Agenten bauen: smolagents von Hugging Face funktioniert mit lokalen Modellen und bietet zwei Agententypen: einen, der handelt, indem er Python-Code schreibt, und einen, der Tools aufruft (Hugging Face, n.d.). In der Integrationsliste von Ollama finden sich außerdem crewAI und any-agent von Mozilla (Ollama, n.d.-e).
- Tools anbinden: MCP ist ein offener Standard, um KI-Anwendungen mit externen Systemen zu verbinden; seine Entwickler vergleichen ihn mit einem USB-C-Anschluss für künstliche Intelligenz (Model Context Protocol, n.d.).
Welche Modelle sich eignen
Für einen Agenten reicht es nicht, dass das Modell intelligent ist: Es muss auch zuverlässig mit Tools umgehen können. Hier einige offene Modelle, die diese Fähigkeit dokumentieren:
- gpt-oss-20b (OpenAI): läuft mit 16 GB Speicher und kann Funktionen aufrufen, im Internet surfen und Python ausführen. Apache-2.0-Lizenz (OpenAI, n.d.).
- Gemma 4 (Google): erhältlich vom E2B bis zum 31B, mit integrierter Tool-Nutzung und Apache-2.0-Lizenz (Google, 2026b).
- Qwen (Alibaba): Qwen3-8B glänzt gerade bei der Tool-Nutzung (Qwen Team, n.d.-c), während Qwen3.5-9B und Qwen3.6-35B-A3B für Agenten und Programmierung ausgelegt sind, ebenfalls unter Apache-2.0-Lizenz (Qwen Team, n.d.-a, n.d.-b).
Wie gut verschiedene Modelle, offene wie geschlossene, mit Tools umgehen, zeigt eine öffentliche Rangliste der University of California, Berkeley: das Berkeley Function Calling Leaderboard (Patil et al., 2026). Ein Blick darauf lohnt sich vor der Wahl, denn es wird häufig aktualisiert.
Lokal oder Cloud: Wann es sich lohnt
- Für lokal: Datenschutz, keine monatlichen Gebühren und keine Nutzungslimits, und es funktioniert ohne Internetverbindung.
- Dagegen: Du brauchst einen guten Rechner und etwas Einrichtung, und die Modelle, die auf einen Heimrechner passen, liegen bei langen, komplexen Aufgaben noch hinter den besten Cloud-Modellen.
Ein vom Europäischen Datenschutzausschuss (EDSA) veröffentlichter Bericht fasst es so zusammen: Das Modell selbst zu hosten, kann mehr Privatsphäre bieten, erfordert aber viel Rechenleistung und technisches Know-how (Barbera, 2025, S. 27).
Wenn du den leistungsfähigsten Agenten brauchst und dich die Cloud nicht stört, schau dir an, was OpenAI, Google, Microsoft und Anthropic anbieten.
Datenschutz und DSGVO
In Deutschland hält die Datenschutzkonferenz (DSK), das Gremium der Datenschutzaufsichtsbehörden, technisch geschlossene Systeme aus Sicht des Datenschutzes für vorzugswürdig. Der Grund: Bei Cloud-Systemen verlassen die Daten die Umgebung, die der Nutzer kontrolliert, und werden häufig in Länder außerhalb der EU übermittelt (Datenschutzkonferenz [DSK], 2024, S. 5–6).
Dabei gibt es zwei wichtige Einschränkungen. Die Orientierungshilfe richtet sich an Unternehmen und Organisationen, nicht an Privatpersonen, und mit einem „geschlossenen System“ ist eine kontrollierte Umgebung gemeint, nicht unbedingt dein Rechner zu Hause. Außerdem entbindet dich ein lokales Modell nicht von den Pflichten der DSGVO, wenn du Daten anderer Personen verarbeitest; es verhindert aber, dass diese Daten an Dritte übermittelt werden.
Häufige Fragen
- Kann man einen KI-Agenten lokal ausführen?
- Ja, solange sowohl das Modell als auch das Agentenprogramm auf deinem Rechner laufen. Bei Ollama kannst du den Cloud-Teil zum Beispiel mit
OLLAMA_NO_CLOUD=1abschalten (Ollama, n.d.-c). Tools, die Internet brauchen, etwa die Websuche, funktionieren offline allerdings nicht. - Was ist der beste lokale KI-Agent?
- Das hängt vom Einsatzzweck ab. Zum Programmieren eignen sich OpenCode oder Claude Code in Verbindung mit einem lokalen Modell (OpenCode, n.d.; Ollama, n.d.-e), für eigene Agenten smolagents (Hugging Face, n.d.). Als Modell empfiehlt sich eines, das gut mit Tools umgeht, etwa gpt-oss-20b, Gemma 4 oder Qwen (OpenAI, n.d.; Google, 2026b; Qwen Team, n.d.-c).
- Was ist ein lokaler KI-Agent?
- Ein Agent, dessen Modell und Programm auf deinem eigenen Rechner laufen, ohne dass deine Eingaben an die Server eines anderen Unternehmens gehen (Ollama, n.d.-c).
- Gibt es kostenlose lokale KI-Agenten?
- Ja. Ollama, llama.cpp, OpenCode und smolagents sind kostenlos und Open Source, und Modelle wie gpt-oss-20b, Gemma 4 und Qwen stehen unter der Apache-2.0-Lizenz (Ollama, n.d.-e; ggml-org, n.d.-a; Hugging Face, n.d.; OpenAI, n.d.; Google, 2026b).
- Wie viel Speicher braucht ein lokaler KI-Agent?
- Das hängt vom Modell ab. Auf 4 Bit komprimiert braucht ein 12B-Modell etwa 6,7 GB und ein 31B-Modell etwa 17,5 GB, allein für das Modell (Google, 2026a). LM Studio empfiehlt mindestens 16 GB RAM (LM Studio, n.d.-a).
- Warum ignoriert mein lokaler KI-Agent die Tools?
- Häufig fehlt ihm Kontext: Bei weniger als 24 GB Grafikspeicher vergibt Ollama standardmäßig nur 4.000 Tokens, obwohl es für Agenten 64.000 empfiehlt (Ollama, n.d.-b).
Weiterlesen
- Was sind KI-Agenten? Erklärt mit Beispielen
- KI-Agenten zum Programmieren: Claude Code vs. Codex vs. Cursor
- Die KI-Agenten von OpenAI, Google, Microsoft und Anthropic im Vergleich
- KI-Agenten bauten ein geheimes Forum — und drangen bei Hugging Face ein
- Alle Blogartikel
Literaturverzeichnis
- Barbera, I. (2025, 10. April). AI privacy risks & mitigations – Large language models (LLMs). European Data Protection Board, Support Pool of Experts. https://www.edpb.europa.eu/system/files/2025-04/ai-privacy-risks-and-mitigations-in-llms.pdf
- Datenschutzkonferenz. (2024, 6. Mai). Orientierungshilfe Künstliche Intelligenz und Datenschutz (Version 1.0). https://www.datenschutzkonferenz-online.de/media/oh/20240506_DSK_Orientierungshilfe_KI_und_Datenschutz.pdf
- ggml-org. (n.d.-a). llama.cpp [GitHub-Repository]. GitHub. Abgerufen am 27. September 2026, von https://github.com/ggml-org/llama.cpp
- ggml-org. (n.d.-b). Function calling [llama.cpp-Dokumentation]. GitHub. Abgerufen am 27. September 2026, von https://github.com/ggml-org/llama.cpp/blob/master/docs/function-calling.md
- Google. (2026a, 8. Juli). Gemma 4 model overview. Google AI for Developers. https://ai.google.dev/gemma/docs/core
- Google. (2026b, 30. Juli). Gemma 4 model card. Google AI for Developers. https://ai.google.dev/gemma/docs/core/model_card_4
- Hugging Face. (n.d.). smolagents [GitHub-Repository]. GitHub. Abgerufen am 27. September 2026, von https://github.com/huggingface/smolagents
- LM Studio. (n.d.-a). System requirements. Abgerufen am 27. September 2026, von https://lmstudio.ai/docs/app/system-requirements
- LM Studio. (n.d.-b). Tool use. Abgerufen am 27. September 2026, von https://lmstudio.ai/docs/developer/openai-compat/tools
- Model Context Protocol. (n.d.). What is the Model Context Protocol (MCP)? Abgerufen am 27. September 2026, von https://modelcontextprotocol.io/docs/getting-started/intro
- Ollama. (n.d.-a). Cloud. Ollama Docs. Abgerufen am 27. September 2026, von https://docs.ollama.com/cloud
- Ollama. (n.d.-b). Context length. Ollama Docs. Abgerufen am 27. September 2026, von https://docs.ollama.com/context-length
- Ollama. (n.d.-c). FAQ. Ollama Docs. Abgerufen am 27. September 2026, von https://docs.ollama.com/faq
- Ollama. (n.d.-d). Tool calling. Ollama Docs. Abgerufen am 27. September 2026, von https://docs.ollama.com/capabilities/tool-calling
- Ollama. (n.d.-e). Ollama [GitHub-Repository]. GitHub. Abgerufen am 27. September 2026, von https://github.com/ollama/ollama
- OpenAI. (n.d.). openai/gpt-oss-20b [Modellkarte]. Hugging Face. Abgerufen am 27. September 2026, von https://huggingface.co/openai/gpt-oss-20b
- OpenCode. (n.d.). Providers. Abgerufen am 27. September 2026, von https://opencode.ai/docs/providers/
- Patil, S. G., et al. (2026, 12. April). Berkeley Function Calling Leaderboard (BFCL) V4. University of California, Berkeley. https://gorilla.cs.berkeley.edu/leaderboard.html
- Qwen Team. (n.d.-a). Qwen/Qwen3.5-9B [Modellkarte]. Hugging Face. Abgerufen am 27. September 2026, von https://huggingface.co/Qwen/Qwen3.5-9B
- Qwen Team. (n.d.-b). Qwen/Qwen3.6-35B-A3B [Modellkarte]. Hugging Face. Abgerufen am 27. September 2026, von https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Qwen Team. (n.d.-c). Qwen/Qwen3-8B [Modellkarte]. Hugging Face. Abgerufen am 27. September 2026, von https://huggingface.co/Qwen/Qwen3-8B