¿Cómo instalar Ollama en Windows y ejecutar tu primer modelo?

Guía paso a paso para instalar Ollama en Windows, descargar y ejecutar tu primer modelo de IA local, elegir el tamaño según tu VRAM y añadir una interfaz gráfica.

E
Publicado el 5 de octubre de 2026

Este artículo contiene enlaces de afiliado: si compras a través de ellos podemos recibir una comisión, sin coste para ti. Más información.

En 30 segundos

Descarga el instalador de Windows desde ollama.com, ejecútalo y abre una terminal. Escribe ollama run seguido del nombre de un modelo de su biblioteca (por ejemplo, gemma3:4b): Ollama lo descarga y abre un chat. Elige un modelo cuyo tamaño quepa en la VRAM de tu gráfica, con algo de margen, para que vaya fluido.

Ollama es la forma más directa de ejecutar modelos de lenguaje en tu propio PC: se instala como cualquier programa, se queda funcionando en segundo plano y descarga los modelos con un solo comando. En Windows, además, trae una aplicación de chat propia, así que la terminal es opcional.

¿Qué necesitas para instalar Ollama en Windows?

Elemento Qué necesitas
Sistema Windows 10 22H2 o posterior (Home o Pro), o Windows 11
Gráfica NVIDIA Drivers 551.61 o posteriores
Gráfica AMD Radeon RX 7000 compatibles con drivers recientes; otras AMD, mediante Vulkan
Gráfica Intel Mediante Vulkan
VRAM Cuanta más, mejores modelos podrás usar con fluidez
RAM 16 GB como mínimo razonable; 32 GB dan más margen
Disco Unos 4 GB para el programa, más lo que ocupen los modelos; mejor en un SSD

Ollama también funciona sin gráfica dedicada, usando el procesador y la RAM, pero las respuestas serán mucho más lentas. La lista oficial de gráficas AMD compatibles en Windows con aceleración nativa se limita a la serie RX 7000 (7900 XTX, 7900 XT, 7900 GRE, 7800 XT, 7700 XT, 7600 XT y 7600); el resto de gráficas recientes se apoyan en Vulkan, que la documentación indica que viene activado por defecto. Revisa la página de hardware compatible porque cambia con cada versión.

Paso 1: descarga e instala Ollama

  1. Entra en ollama.com/download/windows y descarga OllamaSetup.exe.
  2. Ejecuta el archivo y sigue el asistente. Se instala en tu carpeta de usuario, sin necesidad de permisos de administrador.
  3. Al terminar, Ollama queda funcionando en segundo plano. Verás su icono en la bandeja del sistema, junto al reloj.
CuidadoDescarga Ollama siempre desde la web oficial o su página de GitHub. Evita instaladores de terceros y webs que "empaquetan" el programa.

Si quieres instalarlo en otro disco, puedes lanzar el instalador desde una terminal con OllamaSetup.exe /DIR="D:\Ollama". Ollama se actualiza solo: cuando hay una versión nueva, la descarga y basta con pulsar en el icono de la bandeja y elegir Restart to update.

Paso 2: comprueba que funciona

  1. Abre Terminal o PowerShell (busca “terminal” en el menú Inicio).
  2. Escribe:
ollama --version
  1. Si aparece un número de versión, la instalación es correcta. Si Windows dice que no reconoce el comando, cierra la terminal y abre una nueva, o reinicia el PC.

Paso 3: ejecuta tu primer modelo

  1. Entra en la biblioteca de modelos y elige uno. Cada modelo tiene una página con sus variantes de tamaño y el comando exacto para ejecutarlo.
  2. En la terminal, escribe ollama run seguido del nombre y la variante. Por ejemplo, la versión de 4.000 millones de parámetros de Gemma 3, que ocupa 3,3 GB:
ollama run gemma3:4b
  1. La primera vez, Ollama descargará el modelo. Puede tardar un rato según su tamaño y tu conexión.
  2. Cuando termine, aparecerá un indicador para escribir. Escribe tu pregunta y pulsa Intro.
  3. Para salir del chat, escribe /bye.

Si tu equipo es modesto, ollama run llama3.2 descarga una variante de 3B todavía más ligera. Los modelos disponibles cambian a menudo, así que toma los ejemplos como orientativos: consulta en la biblioteca oficial qué variantes ofrece cada uno en cada momento.

Ollama también puede ejecutar directamente modelos GGUF publicados en Hugging Face con ollama run hf.co/usuario/repositorio. Si no sabes qué es GGUF ni qué significa Q4_K_M, lo explicamos en qué es la cuantización y el formato GGUF.

Esquema de Ollama en Windows: la terminal, la app de Ollama y Open WebUI se conectan al servicio de Ollama en localhost:11434, que ejecuta el modelo en la gráfica o, si no cabe, en la CPU y la RAM; los modelos se guardan en la carpeta .ollama\models
Ollama funciona como un servicio en segundo plano: la terminal, su app y otras aplicaciones le piden respuestas a través de localhost:11434.

¿Qué comandos básicos de Ollama vas a usar?

Comando Para qué sirve
ollama run nombre Descarga el modelo si no lo tienes y abre un chat
ollama pull nombre Solo descarga o actualiza el modelo, sin abrir el chat
ollama list Muestra los modelos instalados y lo que ocupan
ollama rm nombre Borra un modelo
ollama ps Muestra qué modelos están cargados y si van en GPU o CPU

Por defecto, un modelo se queda cargado en memoria 5 minutos después de usarlo y luego se descarga solo, para liberar VRAM.

¿Qué tamaño de modelo elegir según tu VRAM?

Los modelos se identifican por su número de parámetros (por ejemplo, 4B, 12B, 27B). Más parámetros suele significar mejores respuestas, pero también más memoria. En la página de cada modelo, Ollama indica cuánto ocupa cada variante; por ejemplo, Gemma 3 en su versión por defecto (Q4_K_M) ocupa 3,3 GB en 4B, 8,1 GB en 12B y 17 GB en 27B.

La regla práctica:

  1. Mira cuánta VRAM tiene tu gráfica (en el Administrador de tareas, pestaña Rendimiento > GPU, aparece como Memoria dedicada de GPU).
  2. Elige una variante cuyo tamaño de descarga quede por debajo de tu VRAM, con algo de margen. El modelo necesita además memoria para el contexto de la conversación.
  3. Si el modelo no cabe, Ollama repartirá parte en la RAM del sistema y en el procesador. Funcionará, pero notablemente más lento.
Tres resultados posibles de la columna PROCESSOR de ollama ps: 100% GPU es lo más rápido, un reparto como 48%/52% CPU/GPU es bastante más lento y 100% CPU es lo más lento; ejemplo de tamaños de gemma3 en Q4_K_M: 3,3, 8,1 y 17 GB
Con ollama ps sabes al momento si el modelo cabe en la gráfica. Si ves un reparto entre CPU y GPU, prueba una variante más pequeña.
ConsejoEmpieza por un modelo pequeño y sube de tamaño mientras la velocidad te resulte cómoda. Si quieres hacer números antes de descargar nada, prueba nuestra herramienta ¿qué IA puedo ejecutar?.

Lo explicamos con más detalle en cuánta VRAM necesito para IA local, y si piensas cargar modelos grandes en memoria del sistema, mira también cuánta RAM necesito.

¿Y la longitud de contexto?

El contexto es cuánto texto “recuerda” el modelo en una conversación. Ollama ajusta el valor por defecto según tu VRAM: 4.000 tokens con menos de 24 GB, 32.000 entre 24 y 48 GB y 256.000 con 48 GB o más. Si vas a pasarle documentos largos, puedes subirlo desde los ajustes de la app o con la variable de entorno OLLAMA_CONTEXT_LENGTH, sabiendo que más contexto pide más memoria.

¿Dónde guarda Ollama los modelos?

Por defecto, Ollama guarda los modelos en C:\Users\tu_usuario\.ollama\models. Los modelos ocupan bastante, así que puede interesarte moverlos a otro disco:

  1. Cierra Ollama desde el icono de la bandeja del sistema.
  2. Abre Editar las variables de entorno de tu cuenta desde el menú Inicio.
  3. Crea una variable de usuario llamada OLLAMA_MODELS con la ruta de la nueva carpeta (por ejemplo, D:\ollama\models).
  4. Guarda y vuelve a abrir Ollama.

Si los guardas en un SSD rápido, los modelos cargarán antes; en SSD NVMe vs SATA explicamos cuándo se nota la diferencia. Ten en cuenta que, si desinstalas Ollama desde Configuración > Aplicaciones, una carpeta de modelos personalizada no se borra sola.

¿Se puede usar Ollama con interfaz gráfica?

Sí. La terminal basta para probar, pero para el uso diario es más cómodo un chat con historial.

  • Aplicación de Ollama: desde julio de 2025, Ollama para Windows y macOS incluye una ventana de chat propia. Permite elegir el modelo, arrastrar archivos de texto o PDF, enviar imágenes a modelos que las admiten y ajustar la longitud de contexto.
  • Open WebUI: una interfaz web de código abierto muy popular que se conecta a Ollama y se usa desde el navegador, con varios usuarios y búsqueda en documentos. Se instala con Docker, con Python o con su aplicación de escritorio; los pasos actualizados están en su documentación oficial.
Ojo con la nubeLa app de Ollama también ofrece modelos que se ejecutan en los servidores de Ollama. Son rápidos en cualquier equipo, pero tus mensajes salen de tu PC. Si buscas privacidad total, elige modelos descargados en local.

Ollama expone además una API local en http://localhost:11434, compatible también con el formato de OpenAI en http://localhost:11434/v1. Es la que usan estas interfaces, las extensiones de editores de código y otras aplicaciones. Si dudas entre Ollama y una aplicación más visual, lo comparamos en Ollama vs LM Studio.

¿Qué hacer si Ollama no funciona bien?

  • El comando ollama no se reconoce: abre una terminal nueva o reinicia tras la instalación.
  • Va muy lento: el modelo probablemente no cabe en la VRAM. Comprueba con ollama ps si aparece 100% GPU o un reparto con la CPU, y prueba una variante más pequeña o menos contexto.
  • No usa la gráfica: actualiza los drivers (en NVIDIA, 551.61 o posteriores) y revisa que tu modelo de gráfica aparezca en la lista de compatibles.
  • Quieres ver qué pasa por dentro: los registros están en %LOCALAPPDATA%\Ollama (app.log y server.log).
  • Te quedas sin espacio: revisa con ollama list y borra lo que no uses con ollama rm.

Resumen

  1. Descarga OllamaSetup.exe desde ollama.com e instálalo.
  2. Abre una terminal y comprueba con ollama --version.
  3. Elige en la biblioteca oficial un modelo que quepa en tu VRAM y ejecútalo con ollama run.
  4. Comprueba con ollama ps que va en la gráfica y gestiona tus modelos con ollama list, ollama pull y ollama rm.
  5. Para una experiencia tipo chat, usa la aplicación de Ollama (con modelos locales si quieres privacidad) u Open WebUI.

Según los usuarios que reportan problemas en GitHub, la incidencia más repetida en Windows es que el modelo acaba ejecutándose en la CPU sin avisar: en un caso documentado con una Radeon RX 7900 XTX, una actualización dejó de cargar capas en la gráfica hasta que se corrigió en una versión posterior. Por eso conviene revisar ollama ps después de cada actualización, sobre todo con gráficas AMD.

Preguntas frecuentes

¿Ollama es gratis?+

Sí. Ollama es software gratuito y de código abierto (licencia MIT), y los modelos de su biblioteca se descargan sin coste. Cada modelo tiene su propia licencia, que conviene revisar si lo vas a usar en un proyecto comercial. Ollama ofrece además modelos en su nube, que es un servicio aparte.

¿Necesito tarjeta gráfica para usar Ollama?+

No es imprescindible: puede funcionar solo con el procesador y la RAM, pero será bastante más lento. En Windows aprovecha gráficas NVIDIA con drivers 551.61 o posteriores, las AMD Radeon RX 7000 compatibles y, mediante Vulkan, otras gráficas AMD e Intel.

¿Dónde guarda Ollama los modelos en Windows?+

Por defecto, en C:\Users\tu_usuario\.ollama\models. Puedes cambiar la ubicación con la variable de entorno OLLAMA_MODELS.

¿Ollama funciona sin conexión a internet?+

Sí. Solo necesitas internet para descargar el programa y los modelos, y para las actualizaciones. Una vez descargados, los modelos locales se ejecutan en tu PC sin conexión.

¿Cómo borro un modelo que ya no uso?+

Con el comando ollama rm seguido del nombre del modelo. Puedes ver los que tienes instalados, y lo que ocupan, con ollama list.

Fuentes

  1. Ollama: descarga para Windows
  2. Documentación de Ollama: Windows
  3. Documentación de Ollama: hardware compatible
  4. Documentación de Ollama: preguntas frecuentes
  5. Documentación de Ollama: longitud de contexto
  6. Ollama Blog: la nueva app de Ollama (julio de 2025)
  7. Biblioteca de modelos de Ollama: gemma3
  8. Ollama en GitHub
  9. Hugging Face: usar Ollama con modelos GGUF del Hub
  10. Documentación de Open WebUI
  11. GitHub, ollama/ollama #12564: sin capas en la GPU con una RX 7900 XTX en Windows

Sigue leyendo