Inteligencia Artificial · Guía práctica
Agentes de IA locales: cómo usarlos en tu propio computador
Qué significa realmente «local», qué computador necesitas, qué programas y modelos conviene usar y cuándo compensa frente a ChatGPT o Claude. Sin enviar tus datos a nadie.
Por Dravvt · Septiembre de 2026 · 9 min de lectura

Cada vez que usas ChatGPT o Claude, lo que escribes viaja a los servidores de otra empresa. En muchos casos eso no importa, pero con el código de un cliente, documentos de trabajo o datos personales la cosa cambia. La alternativa es tener el agente en tu propio computador, con el modelo, las herramientas y los datos bajo tu control.
En 2026 esto ya es viable con un computador de gama media-alta. En este artículo explico qué significa exactamente «local», que no es tan obvio como parece, qué hardware necesitas, qué programas usar, qué modelos funcionan bien como agentes y cuándo compensa frente a la nube.
Qué significa «agente local» (y qué no)
Un agente tiene dos partes: el modelo, que razona, y el programa del agente, que ejecuta el ciclo de pensar, usar una herramienta y revisar el resultado. Si esta idea te resulta nueva, la explico en qué son los agentes de IA. Para que un agente sea realmente local, ambas partes tienen que funcionar en tu computador.
Aquí hay una trampa. Muchas herramientas de agentes se instalan en tu computador, pero envían cada consulta a un modelo en la nube. Incluso Ollama, el programa más popular para ejecutar modelos locales, ofrece ahora modelos que se ejecutan en su propia nube (Ollama, n.d.-a). Cuando el modelo sí funciona en tu máquina, su documentación es clara: la empresa no ve lo que escribes ni tus datos (Ollama, n.d.-c). Si quieres asegurarte de que nada salga de tu computador, puedes desactivar la parte de nube con la variable OLLAMA_NO_CLOUD=1 (Ollama, n.d.-c).
Qué computador necesitas
Lo decisivo es la memoria: el modelo completo tiene que caber en la memoria de la tarjeta gráfica (VRAM) o, con menos velocidad, en la RAM del sistema. LM Studio, uno de los programas más utilizados, recomienda al menos 16 GB de RAM y, en Windows y Linux, un mínimo de 4 GB de memoria gráfica dedicada; en Mac necesita un procesador Apple Silicon (LM Studio, n.d.-a).
Para hacerse una idea, esta es la memoria que Google indica únicamente para cargar los pesos de sus modelos abiertos Gemma 4 (Google, 2026a). «Q4» significa comprimido a 4 bits, que es la forma habitual de usarlos en un equipo doméstico:
| Modelo | Sin comprimir (BF16) | Comprimido (Q4) |
|---|---|---|
| Gemma 4 E2B | 11,4 GB | 2,9 GB |
| Gemma 4 E4B | 17,9 GB | 4,5 GB |
| Gemma 4 12B | 26,7 GB | 6,7 GB |
| Gemma 4 26B A4B | 57,7 GB | 14,4 GB |
| Gemma 4 31B | 69,9 GB | 17,5 GB |
Conviene tener en cuenta dos detalles. El primero es que esas cifras corresponden solo al modelo: Google aclara que no incluyen la memoria adicional que necesitan el programa y el contexto, es decir, el texto que el modelo mantiene presente mientras trabaja (Google, 2026a). El segundo es que en los modelos de tipo MoE, como el 26B A4B, aunque solo se activan unos 4000 millones de parámetros a la vez, hay que cargar en memoria los 26 000 millones (Google, 2026a).
¿Y sin tarjeta gráfica? También es posible: llama.cpp funciona solo con el procesador o repartiendo el trabajo entre el procesador y la tarjeta gráfica (ggml-org, n.d.-a). Es más lento, pero funciona.
El error más común: quedarse corto de contexto
Los agentes necesitan mucho contexto, porque van acumulando lo que leen, las herramientas que usan y los resultados que obtienen. Ollama ajusta el contexto según la memoria gráfica disponible: con menos de 24 GB asigna por defecto solo 4000 tokens, cuando para agentes y herramientas de programación recomienda al menos 64 000 (Ollama, n.d.-b).
Si tu agente local ignora las herramientas o pierde el hilo a mitad de una tarea, esto es lo primero que debes revisar. Para ampliar el contexto, basta con iniciar Ollama con OLLAMA_CONTEXT_LENGTH=64000 ollama serve (Ollama, n.d.-b).
Los programas para ejecutar el modelo
- Ollama: el más sencillo. Es gratuito, de código abierto (licencia MIT) y está disponible para Mac, Windows y Linux. Descargas un modelo con un solo comando y queda listo en tu computador (Ollama, n.d.-e). Permite que el modelo use herramientas, incluso varias a la vez, y ejecutar ciclos de agente completos (Ollama, n.d.-d).
- llama.cpp: el motor que funciona por debajo de muchos de estos programas. Es más técnico, pero también el que ofrece más control. Funciona con el procesador y con casi cualquier tarjeta gráfica, y también permite usar herramientas (ggml-org, n.d.-a, n.d.-b).
- LM Studio: la opción con interfaz gráfica, sin necesidad de usar la terminal. Marca con un icono de martillo los modelos que saben usar herramientas de forma nativa (LM Studio, n.d.-b).
Los tres ofrecen una conexión compatible con la de OpenAI, de modo que muchos programas pensados para ChatGPT pueden trabajar con tu modelo local cambiando solo la dirección del servidor (LM Studio, n.d.-b; OpenCode, n.d.).
Los programas de agente compatibles con modelos locales
- Agentes de programación: Ollama se conecta directamente con Claude Code, Codex, OpenCode y otras herramientas mediante su comando
ollama launch(Ollama, n.d.-e). OpenCode, de código abierto, funciona con Ollama, LM Studio o llama.cpp (OpenCode, n.d.). Comparo los agentes de programación más usados en Claude Code vs Codex vs Cursor. - Para construir agentes propios: smolagents, de Hugging Face, funciona con modelos locales y ofrece dos tipos de agente: uno que actúa escribiendo código en Python y otro que llama a herramientas (Hugging Face, n.d.). En la lista de integraciones de Ollama también aparecen crewAI y any-agent, de Mozilla (Ollama, n.d.-e).
- Conectar herramientas: MCP es un estándar abierto para conectar aplicaciones de IA con sistemas externos; sus creadores lo comparan con un puerto USB-C para la inteligencia artificial (Model Context Protocol, n.d.).
Qué modelos usar
Para un agente no basta con que el modelo sea inteligente: también tiene que saber usar herramientas correctamente. Estos son algunos modelos abiertos que documentan esa capacidad:
- gpt-oss-20b (OpenAI): funciona con 16 GB de memoria y permite llamar funciones, navegar por internet y ejecutar Python. Licencia Apache 2.0 (OpenAI, n.d.).
- Gemma 4 (Google): disponible desde el E2B hasta el 31B, con uso de herramientas integrado y licencia Apache 2.0 (Google, 2026b).
- Qwen (Alibaba): Qwen3-8B destaca precisamente en el uso de herramientas (Qwen Team, n.d.-c), y Qwen3.5-9B y Qwen3.6-35B-A3B están pensados para agentes y programación, también con licencia Apache 2.0 (Qwen Team, n.d.-a, n.d.-b).
Para comparar qué tan bien usan las herramientas los distintos modelos, abiertos y cerrados, existe una clasificación pública de la Universidad de California en Berkeley, la Berkeley Function Calling Leaderboard (Patil et al., 2026). Vale la pena consultarla antes de elegir, porque se actualiza con frecuencia.
Local frente a nube: cuándo compensa
- A favor de lo local: privacidad, ausencia de cuotas mensuales y de límites de uso, y funcionamiento sin conexión a internet.
- En contra: requiere un buen computador y cierta configuración, y los modelos que caben en un equipo doméstico siguen por detrás de los mejores modelos en la nube en tareas largas y complejas.
Un informe publicado por el Comité Europeo de Protección de Datos lo resume así: alojar el modelo uno mismo puede ofrecer más privacidad, pero exige muchos recursos de cómputo y conocimientos técnicos (Barbera, 2025, p. 27).
Si lo que necesitas es el agente más capaz posible y no te importa usar la nube, revisa lo que ofrecen OpenAI, Google, Microsoft y Anthropic.
Privacidad y RGPD
En Alemania, la conferencia de autoridades de protección de datos (Datenschutzkonferenz [DSK]) considera que los sistemas técnicamente cerrados son preferibles desde el punto de vista de la protección de datos. El motivo es que, con los sistemas en la nube, los datos salen del entorno que controla el usuario y con frecuencia se transfieren a países fuera de la UE (Datenschutzkonferenz [DSK], 2024, pp. 5–6).
Hay dos matices importantes. La guía está dirigida a empresas y organizaciones, no a particulares, y por «sistema cerrado» entiende un entorno controlado, no necesariamente el computador de tu casa. Además, usar un modelo local no te exime de las obligaciones del RGPD si tratas datos de otras personas; lo que sí consigue es evitar que esos datos se envíen a un tercero.
Preguntas frecuentes
- ¿Se puede usar un agente de IA en local?
- Sí, siempre que tanto el modelo como el programa del agente se ejecuten en tu computador. Con Ollama, por ejemplo, puedes desactivar la parte de nube con
OLLAMA_NO_CLOUD=1(Ollama, n.d.-c). Eso sí, las herramientas que necesitan internet, como la búsqueda web, no funcionarán sin conexión. - ¿Cuál es el mejor agente de IA local?
- Depende del uso. Para programar, OpenCode o Claude Code conectados a un modelo local (OpenCode, n.d.; Ollama, n.d.-e); para construir tus propios agentes, smolagents (Hugging Face, n.d.). Como modelo, conviene uno que use bien las herramientas, como gpt-oss-20b, Gemma 4 o Qwen (OpenAI, n.d.; Google, 2026b; Qwen Team, n.d.-c).
- ¿Qué es un agente local en IA?
- Un agente cuyo modelo y cuyo programa se ejecutan en tu propio computador, sin enviar lo que escribes a los servidores de otra empresa (Ollama, n.d.-c).
- ¿Hay algún agente de IA local gratuito?
- Sí. Ollama, llama.cpp, OpenCode y smolagents son gratuitos y de código abierto, y modelos como gpt-oss-20b, Gemma 4 y Qwen tienen licencia Apache 2.0 (Ollama, n.d.-e; ggml-org, n.d.-a; Hugging Face, n.d.; OpenAI, n.d.; Google, 2026b).
- ¿Cuánta memoria necesito?
- Depende del modelo. Comprimido a 4 bits, un modelo de 12B necesita unos 6,7 GB y uno de 31B unos 17,5 GB, solo para el modelo (Google, 2026a). LM Studio recomienda al menos 16 GB de RAM (LM Studio, n.d.-a).
- ¿Por qué mi agente local ignora las herramientas?
- Con frecuencia se debe a que le falta contexto: con menos de 24 GB de memoria gráfica, Ollama asigna por defecto solo 4000 tokens, cuando para agentes recomienda 64 000 (Ollama, n.d.-b).
Sigue leyendo
- Qué son los agentes de IA, explicado con ejemplos
- Agentes de IA para programar: Claude Code vs Codex vs Cursor
- Los agentes de OpenAI, Google, Microsoft y Anthropic comparados
- Unos agentes de IA montaron un foro secreto y acabaron dentro de Hugging Face
- Todos los artículos del blog
Referencias
- Barbera, I. (2025, 10 de abril). AI privacy risks & mitigations – Large language models (LLMs). European Data Protection Board, Support Pool of Experts. https://www.edpb.europa.eu/system/files/2025-04/ai-privacy-risks-and-mitigations-in-llms.pdf
- Datenschutzkonferenz. (2024, 6 de mayo). Orientierungshilfe Künstliche Intelligenz und Datenschutz (Versión 1.0). https://www.datenschutzkonferenz-online.de/media/oh/20240506_DSK_Orientierungshilfe_KI_und_Datenschutz.pdf
- ggml-org. (n.d.-a). llama.cpp [Repositorio de GitHub]. GitHub. Recuperado el 27 de septiembre de 2026, de https://github.com/ggml-org/llama.cpp
- ggml-org. (n.d.-b). Function calling [Documentación de llama.cpp]. GitHub. Recuperado el 27 de septiembre de 2026, de https://github.com/ggml-org/llama.cpp/blob/master/docs/function-calling.md
- Google. (2026a, 8 de julio). Gemma 4 model overview. Google AI for Developers. https://ai.google.dev/gemma/docs/core
- Google. (2026b, 30 de julio). Gemma 4 model card. Google AI for Developers. https://ai.google.dev/gemma/docs/core/model_card_4
- Hugging Face. (n.d.). smolagents [Repositorio de GitHub]. GitHub. Recuperado el 27 de septiembre de 2026, de https://github.com/huggingface/smolagents
- LM Studio. (n.d.-a). System requirements. Recuperado el 27 de septiembre de 2026, de https://lmstudio.ai/docs/app/system-requirements
- LM Studio. (n.d.-b). Tool use. Recuperado el 27 de septiembre de 2026, de https://lmstudio.ai/docs/developer/openai-compat/tools
- Model Context Protocol. (n.d.). What is the Model Context Protocol (MCP)? Recuperado el 27 de septiembre de 2026, de https://modelcontextprotocol.io/docs/getting-started/intro
- Ollama. (n.d.-a). Cloud. Ollama Docs. Recuperado el 27 de septiembre de 2026, de https://docs.ollama.com/cloud
- Ollama. (n.d.-b). Context length. Ollama Docs. Recuperado el 27 de septiembre de 2026, de https://docs.ollama.com/context-length
- Ollama. (n.d.-c). FAQ. Ollama Docs. Recuperado el 27 de septiembre de 2026, de https://docs.ollama.com/faq
- Ollama. (n.d.-d). Tool calling. Ollama Docs. Recuperado el 27 de septiembre de 2026, de https://docs.ollama.com/capabilities/tool-calling
- Ollama. (n.d.-e). Ollama [Repositorio de GitHub]. GitHub. Recuperado el 27 de septiembre de 2026, de https://github.com/ollama/ollama
- OpenAI. (n.d.). openai/gpt-oss-20b [Ficha del modelo]. Hugging Face. Recuperado el 27 de septiembre de 2026, de https://huggingface.co/openai/gpt-oss-20b
- OpenCode. (n.d.). Providers. Recuperado el 27 de septiembre de 2026, de https://opencode.ai/docs/providers/
- Patil, S. G., et al. (2026, 12 de abril). Berkeley Function Calling Leaderboard (BFCL) V4. University of California, Berkeley. https://gorilla.cs.berkeley.edu/leaderboard.html
- Qwen Team. (n.d.-a). Qwen/Qwen3.5-9B [Ficha del modelo]. Hugging Face. Recuperado el 27 de septiembre de 2026, de https://huggingface.co/Qwen/Qwen3.5-9B
- Qwen Team. (n.d.-b). Qwen/Qwen3.6-35B-A3B [Ficha del modelo]. Hugging Face. Recuperado el 27 de septiembre de 2026, de https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Qwen Team. (n.d.-c). Qwen/Qwen3-8B [Ficha del modelo]. Hugging Face. Recuperado el 27 de septiembre de 2026, de https://huggingface.co/Qwen/Qwen3-8B