¿Qué IA puedo ejecutar en local con mi gráfica?
Con 8 GB de VRAM caben modelos de hasta 8B a 4 bits; con 12 GB, de 14B; con 24 GB, de 27-32B, y un modelo de 70B pide unos 41 GB, más de lo que tiene cualquier gráfica de consumo. Elige tu tarjeta gráfica o tu Mac y verás qué tamaños caben en su memoria; es una estimación orientativa que cambia según el programa, el modelo y la longitud de la conversación.

| Tamaño del modelo | Ejemplos | 4 bits | 8 bits | 16 bits |
|---|
Cabe: entra entero en la memoria y debería ir fluido. Justo: entra con poco margen; reduce el contexto o cierra otros programas. No cabe: tendría que usar la RAM del sistema y irá mucho más lento.
¿Te quedas corto? Equipos con mucha memoria para IA local
Si quieres ejecutar modelos de 70B o más sin montar varias gráficas, estas son las opciones más habituales hoy.
Mini PC de NVIDIA con chip Grace Blackwell pensado para desarrollar y ejecutar modelos grandes en local. Lo venden también marcas como ASUS, Dell, HP o MSI con otros nombres.
Leer la noticia ›Mini PC y portátiles con gráfica integrada potente que comparte la RAM del sistema. Permiten cargar modelos grandes sin gráfica dedicada.
Ver modelos ›Silenciosos y eficientes. Con mucha memoria unificada cargan modelos muy grandes; son más lentos generando que una gráfica dedicada potente.
Ver en Apple ›Respuesta rápida: ¿qué IA puedo ejecutar en mi PC?
Lo que decide qué modelo puedes usar en local es la memoria: la VRAM de la gráfica o la memoria unificada de un Mac o de un mini PC. A 4 bits, que es lo habitual en Ollama o LM Studio, cuenta algo más de medio giga por cada mil millones de parámetros: un modelo de 8B pide unos 5,6 GB, uno de 14B unos 9 GB, uno de 32B unos 19,4 GB y uno de 70B unos 41,3 GB (con contexto normal de chat).
¿Cuánta VRAM necesita un LLM? Tabla por tamaño de modelo
Memoria estimada con contexto normal y la memoria mínima con la que el modelo cabe holgado a 4 bits. En los Mac y los mini PC con memoria compartida se cuenta solo el 70 % de la memoria total.
| Modelo | 4 bits | 8 bits | 16 bits | Gráfica mínima (4 bits) | Mac / memoria compartida (4 bits) |
|---|---|---|---|---|---|
| 3B (Llama 3.2 3B) | 2,7 GB | 4,4 GB | 7,9 GB | 8 GB | 6 GB |
| 8B (Llama 3.1 8B, Qwen 7-8B) | 5,6 GB | 10,2 GB | 19,4 GB | 8 GB | 10 GB |
| 14B (Qwen 14B) | 9 GB | 17,1 GB | 33,2 GB | 12 GB | 16 GB |
| 27B (Gemma 27B) | 16,5 GB | 32,1 GB | 63,1 GB | 20 GB | 32 GB |
| 32B (Qwen 32B) | 19,4 GB | 37,8 GB | 74,6 GB | 24 GB | 32 GB |
| 70B (Llama 70B) | 41,3 GB | 81,5 GB | 162 GB | Ninguna de consumo | 96 GB |
| 120B (Modelos de más de 100B) | 70 GB | 139 GB | 277 GB | Ninguna de consumo | 128 GB |
¿Cómo se calcula?
Partimos de una regla aproximada: cada mil millones de parámetros ocupan medio giga a 4 bits, un giga a 8 bits y dos gigas a 16 bits. Sumamos un 15 % de margen y la memoria del contexto. En los Mac y en los equipos con memoria compartida solo contamos alrededor del 70 % de la memoria, porque el sistema se reserva el resto.
Memoria necesaria = parámetros (miles de millones) × bits ÷ 8 × 1,15 + contexto, con 1 GB de contexto para un chat normal, 3 GB para documentos largos y 6 GB para contextos muy largos. Ejemplo: un modelo de 8B a 4 bits necesita 8 × 0,5 × 1,15 + 1 ≈ 5,6 GB. En una gráfica descontamos medio giga para el sistema, y el modelo «cabe» si ocupa como mucho el 90 % de lo que queda.
¿Qué significa 4, 8 o 16 bits?
Es la cuantización: cuánto se comprime el modelo. A 4 bits ocupa la cuarta parte que a 16 y pierde muy poca calidad en el uso diario, por eso es lo más habitual en local. A 8 bits la calidad es casi idéntica al original.
Preguntas frecuentes
¿Cuánta memoria necesita un modelo de IA en local?+
Como regla aproximada, un modelo cuantizado a 4 bits ocupa algo más de medio giga por cada mil millones de parámetros, más la memoria del contexto. Un modelo de 8B a 4 bits ronda los 5-6 GB; uno de 32B, unos 19-20 GB, y uno de 70B, unos 41 GB.
¿Qué IA puedo usar con 8 GB de VRAM?+
Con una gráfica de 8 GB caben modelos de hasta unos 8B parámetros a 4 bits (unos 5,6 GB con contexto normal), como Llama 3.1 8B o Qwen de 7-8B. Los de 14B a 4 bits (unos 9 GB) ya no caben enteros y tendrían que usar la RAM del sistema.
¿Qué modelos caben en 12, 16 o 24 GB?+
Con 12 GB caben modelos de 14B a 4 bits (unos 9 GB). Con 16 GB, también 8B a 8 bits, pero un 27B a 4 bits (unos 16,5 GB) se queda fuera. Con 24 GB caben modelos de 27B y 32B a 4 bits (unos 19-20 GB).
¿Qué pasa si el modelo no cabe en la gráfica?+
Programas como Ollama o LM Studio pueden repartir el modelo entre la gráfica y la RAM del ordenador. Funciona, pero la velocidad cae mucho en cuanto una parte va a la RAM.
¿Qué requisitos necesita Ollama o LM Studio?+
El requisito que más manda es la memoria del modelo que quieras usar, no el programa. Como orientación, para un modelo de 8B a 4 bits necesitas unos 6 GB libres de VRAM o de memoria unificada; para uno de 32B, unos 20 GB.
¿Sirve un Mac para ejecutar IA en local?+
Sí. Los Mac con Apple Silicon comparten la memoria entre procesador y gráfica, así que pueden cargar modelos grandes. macOS reserva una parte para el sistema, por eso la calculadora usa solo alrededor del 70 % de la memoria total: con 64 GB, unos 45 GB útiles.
¿Es mejor una gráfica NVIDIA o AMD para IA local?+
NVIDIA tiene el soporte más amplio gracias a CUDA y casi todo funciona a la primera. AMD funciona cada vez mejor con herramientas como Ollama o LM Studio, pero conviene comprobar la compatibilidad de tu modelo de gráfica.