Vídeo: canal Alejavi Rivera en YouTube. Los derechos del vídeo pertenecen a su autor.
Imagen ilustrativa: Unsplash
La promesa circula por foros y vídeos: un agente de programación en la terminal, gratis y sin límites, con modelos que corren en tu propio ordenador. La realidad tiene matices que conviene conocer antes de cancelar ninguna suscripción. Aquí repasamos qué es Claude Code, cuánto cuesta en realidad y cómo se conecta con Ollama para trabajar con modelos abiertos en local.
Qué hace realmente un agente de programación en terminal
Un agente de terminal no es un chat al que pegas código. Se ejecuta dentro de la carpeta de tu proyecto y actúa sobre ella: lee y edita archivos, busca por el repositorio, ejecuta compilaciones o pruebas, lee el error y vuelve a intentarlo. Tú apruebas las acciones sensibles. Ese contexto real del proyecto, sumado a la capacidad de ejecutar y corregir, es lo que lo separa de un autocompletado.
Claude Code es la implementación de Anthropic. Funciona en macOS, Windows y Linux, con requisitos modestos de memoria, pero necesita conexión a internet porque el modelo se ejecuta en los servidores de Anthropic, no en tu equipo.
Qué cuesta la opción comercial y qué límites tiene
Primer matiz importante: el programa se descarga sin coste, pero el acceso a los modelos no. La documentación es explícita: Claude Code necesita una cuenta de pago o crédito en la consola de desarrolladores, y el plan gratuito de Claude no lo incluye.
Tampoco es ilimitado. Los planes comparten un cupo de uso entre la aplicación web y la terminal, con avisos al acercarte al tope; puedes consultarlo con la orden /status. Si lo agotas, toca esperar al reinicio, pasar a facturación por consumo o subir de plan. También existe la vía de pago por uso a través de los principales proveedores de nube.
Modelos locales: sí funciona, pero con letra pequeña
Ollama añadió compatibilidad con la API de mensajes de Anthropic, lo que permite apuntar Claude Code a un servidor local: hay soporte declarado para conversaciones de varios turnos, streaming, prompts de sistema, llamada a herramientas y visión. La documentación de Ollama incluye una página dedicada a Claude Code.
La letra pequeña viene del otro lado. Anthropic documenta la variable ANTHROPIC_BASE_URL para pasarelas corporativas, pero advierte que no respalda ni audita productos de terceros y que no da soporte a enrutar Claude Code hacia modelos que no sean Claude. Traducido: el montaje funciona porque Ollama imita el formato de la API, no porque sea un escenario oficial. Una actualización de cualquiera de las dos partes puede romperlo, y no habrá soporte que reclamar. Además, al fijar una credencial de pasarela la sesión deja de usar tu suscripción.
Requisitos de memoria por tamaño de modelo
El coste de la nube desaparece, pero se traslada al hardware. Cifras orientativas de las fichas oficiales en Ollama:
- Modelos de 7B a 8B de código: alrededor de 5 GB. Suelo razonable para tareas pequeñas en un portátil de 16 GB de RAM.
- Modelos de 14B: unos 9 GB, con salto claro de calidad.
- gpt-oss 20B: unos 14 GB de descarga y 16 GB de memoria como mínimo según su ficha, con licencia Apache 2.0.
- Qwen3-Coder 30B: unos 19 GB, con contexto muy amplio y pocos parámetros activos, lo que ayuda a la velocidad.
- Modelos de 32B: unos 20 GB, terreno de GPU de 24 GB o Mac con memoria unificada amplia.
- Modelos de 120B o superiores: decenas o cientos de GB. Fuera del alcance doméstico.
Un factor que mucha gente pasa por alto es la ventana de contexto. Ollama la ajusta por defecto según la memoria disponible, y para herramientas de código conviene ampliarla bastante. Ampliarla consume más memoria, así que el presupuesto real es el modelo más su contexto.
Instalación paso a paso
1. Instalar Ollama y descargar un modelo
Descarga el instalador desde el sitio oficial para macOS, Windows o Linux y luego baja un modelo:
ollama pull gpt-oss:20b
Comprueba que responde y que se está ejecutando en la GPU:
ollama run gpt-oss:20b
ollama ps
2. Servir con una ventana de contexto amplia
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
3. Instalar Claude Code
Existe instalador nativo para macOS, Linux y Windows, y también paquete de npm, que exige una versión reciente de Node.js:
npm install -g @anthropic-ai/claude-code
Verifica con claude --version o, si algo falla, con claude doctor.
4. Conectar el agente al servidor local
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model gpt-oss:20b
Si prefieres otro cliente, el mismo servidor expone una API compatible con la de OpenAI en http://localhost:11434/v1/, con endpoints como /v1/chat/completions y /v1/models.
Agentes abiertos que ya hablan con Ollama
Si te incomoda depender de una compatibilidad no soportada, hay agentes de terminal abiertos pensados desde el principio para proveedores locales. Aider documenta la conexión con Ollama y se integra muy bien con Git. OpenCode incluye Ollama entre sus proveedores y ofrece una interfaz más cercana a la de un agente completo. Ninguno cobra licencia y ambos aceptan claves de la nube si algún día las necesitas.
Calidad real: qué se gana y qué se pierde
Seamos honestos. Un modelo de 20B o 30B cuantizado resuelve bien funciones aisladas, scripts, pruebas unitarias, documentación y refactores acotados. La diferencia se nota en tareas largas de varios archivos, en usar herramientas sin equivocarse de formato y en mantener la coherencia durante sesiones extensas. La velocidad también depende del equipo: sin GPU, el trabajo cae en la CPU y las esperas dejan de ser cómodas.
Y sobre lo de gratis: no pagas por token, pero sí en hardware, electricidad y tiempo. Lo de sin límites tampoco es exacto, solo cambia quién pone el límite: tu memoria RAM en lugar de una cuota mensual.
La privacidad sí es una ventaja real
Es la razón más sólida para lo local, y no es marketing. Con Ollama, el código, las claves que asomen en un archivo de configuración y los datos de tus clientes nunca salen de la máquina. Para trabajo bajo acuerdos de confidencialidad o código regulado, eso resuelve una conversación entera con el departamento legal. Como extra, el modelo funciona sin conexión.
Cuándo compensa cada opción
Si programas a diario en proyectos grandes y el tiempo es tu recurso escaso, la suscripción de pago gana por calidad y soporte. Si tu limitación es la confidencialidad, trabajas sin conexión estable o quieres aprender sin factura variable, la vía local tiene sentido, sobre todo con 32 GB de RAM o una GPU de 16 GB en adelante. Y queda una tercera opción muy sensata: el modelo local para lo repetitivo y la nube para lo difícil.
Fuentes: documentación de instalación de Claude Code, pasarelas LLM en Claude Code, planes y precios de Claude, guía de Ollama para Claude Code, compatibilidad de Ollama con la API de OpenAI, ficha de gpt-oss, ficha de Qwen3-Coder, Aider con Ollama y proveedores de OpenCode.
Relacionado: cuando conectas herramientas a un agente por MCP y el cliente no las reconoce, la guía servidor MCP configurado pero no aparece en el cliente recoge las causas más frecuentes y cómo aislar el servidor fuera del cliente.
No te pierdas lo próximo que publiquemos
Cada día, las noticias y guías de inteligencia artificial que importan, directas a tu correo.
Es gratis. Sin spam. Puedes darte de baja cuando quieras.