Herramienta gratuita

¿Qué IA puedo ejecutar en local con mi gráfica?

Con 8 GB de VRAM caben modelos de hasta 8B a 4 bits; con 12 GB, de 14B; con 24 GB, de 27-32B, y un modelo de 70B pide unos 41 GB, más de lo que tiene cualquier gráfica de consumo. Elige tu tarjeta gráfica o tu Mac y verás qué tamaños caben en su memoria; es una estimación orientativa que cambia según el programa, el modelo y la longitud de la conversación.

Foto: Đào Hiếu / Unsplash

Tamaño del modeloEjemplos4 bits8 bits16 bits

Cabe: entra entero en la memoria y debería ir fluido. Justo: entra con poco margen; reduce el contexto o cierra otros programas. No cabe: tendría que usar la RAM del sistema y irá mucho más lento.

¿Te quedas corto? Equipos con mucha memoria para IA local

Si quieres ejecutar modelos de 70B o más sin montar varias gráficas, estas son las opciones más habituales hoy.

NVIDIA DGX Spark
64 o 128 GB de memoria unificada

Mini PC de NVIDIA con chip Grace Blackwell pensado para desarrollar y ejecutar modelos grandes en local. Lo venden también marcas como ASUS, Dell, HP o MSI con otros nombres.

Leer la noticia ›
Mini PC con AMD Ryzen AI Max
Hasta 128 GB de memoria compartida

Mini PC y portátiles con gráfica integrada potente que comparte la RAM del sistema. Permiten cargar modelos grandes sin gráfica dedicada.

Ver modelos ›
Mac Studio / Mac mini con Apple Silicon
Configurable con mucha memoria unificada

Silenciosos y eficientes. Con mucha memoria unificada cargan modelos muy grandes; son más lentos generando que una gráfica dedicada potente.

Ver en Apple ›

Respuesta rápida: ¿qué IA puedo ejecutar en mi PC?

Lo que decide qué modelo puedes usar en local es la memoria: la VRAM de la gráfica o la memoria unificada de un Mac o de un mini PC. A 4 bits, que es lo habitual en Ollama o LM Studio, cuenta algo más de medio giga por cada mil millones de parámetros: un modelo de 8B pide unos 5,6 GB, uno de 14B unos 9 GB, uno de 32B unos 19,4 GB y uno de 70B unos 41,3 GB (con contexto normal de chat).

¿Cuánta VRAM necesita un LLM? Tabla por tamaño de modelo

Memoria estimada con contexto normal y la memoria mínima con la que el modelo cabe holgado a 4 bits. En los Mac y los mini PC con memoria compartida se cuenta solo el 70 % de la memoria total.

Modelo4 bits8 bits16 bitsGráfica mínima (4 bits)Mac / memoria compartida (4 bits)
3B (Llama 3.2 3B)2,7 GB4,4 GB7,9 GB8 GB6 GB
8B (Llama 3.1 8B, Qwen 7-8B)5,6 GB10,2 GB19,4 GB8 GB10 GB
14B (Qwen 14B)9 GB17,1 GB33,2 GB12 GB16 GB
27B (Gemma 27B)16,5 GB32,1 GB63,1 GB20 GB32 GB
32B (Qwen 32B)19,4 GB37,8 GB74,6 GB24 GB32 GB
70B (Llama 70B)41,3 GB81,5 GB162 GBNinguna de consumo96 GB
120B (Modelos de más de 100B)70 GB139 GB277 GBNinguna de consumo128 GB

¿Cómo se calcula?

Partimos de una regla aproximada: cada mil millones de parámetros ocupan medio giga a 4 bits, un giga a 8 bits y dos gigas a 16 bits. Sumamos un 15 % de margen y la memoria del contexto. En los Mac y en los equipos con memoria compartida solo contamos alrededor del 70 % de la memoria, porque el sistema se reserva el resto.

Memoria necesaria = parámetros (miles de millones) × bits ÷ 8 × 1,15 + contexto, con 1 GB de contexto para un chat normal, 3 GB para documentos largos y 6 GB para contextos muy largos. Ejemplo: un modelo de 8B a 4 bits necesita 8 × 0,5 × 1,15 + 1 ≈ 5,6 GB. En una gráfica descontamos medio giga para el sistema, y el modelo «cabe» si ocupa como mucho el 90 % de lo que queda.

¿Qué significa 4, 8 o 16 bits?

Es la cuantización: cuánto se comprime el modelo. A 4 bits ocupa la cuarta parte que a 16 y pierde muy poca calidad en el uso diario, por eso es lo más habitual en local. A 8 bits la calidad es casi idéntica al original.

Preguntas frecuentes

¿Cuánta memoria necesita un modelo de IA en local?+

Como regla aproximada, un modelo cuantizado a 4 bits ocupa algo más de medio giga por cada mil millones de parámetros, más la memoria del contexto. Un modelo de 8B a 4 bits ronda los 5-6 GB; uno de 32B, unos 19-20 GB, y uno de 70B, unos 41 GB.

¿Qué IA puedo usar con 8 GB de VRAM?+

Con una gráfica de 8 GB caben modelos de hasta unos 8B parámetros a 4 bits (unos 5,6 GB con contexto normal), como Llama 3.1 8B o Qwen de 7-8B. Los de 14B a 4 bits (unos 9 GB) ya no caben enteros y tendrían que usar la RAM del sistema.

¿Qué modelos caben en 12, 16 o 24 GB?+

Con 12 GB caben modelos de 14B a 4 bits (unos 9 GB). Con 16 GB, también 8B a 8 bits, pero un 27B a 4 bits (unos 16,5 GB) se queda fuera. Con 24 GB caben modelos de 27B y 32B a 4 bits (unos 19-20 GB).

¿Qué pasa si el modelo no cabe en la gráfica?+

Programas como Ollama o LM Studio pueden repartir el modelo entre la gráfica y la RAM del ordenador. Funciona, pero la velocidad cae mucho en cuanto una parte va a la RAM.

¿Qué requisitos necesita Ollama o LM Studio?+

El requisito que más manda es la memoria del modelo que quieras usar, no el programa. Como orientación, para un modelo de 8B a 4 bits necesitas unos 6 GB libres de VRAM o de memoria unificada; para uno de 32B, unos 20 GB.

¿Sirve un Mac para ejecutar IA en local?+

Sí. Los Mac con Apple Silicon comparten la memoria entre procesador y gráfica, así que pueden cargar modelos grandes. macOS reserva una parte para el sistema, por eso la calculadora usa solo alrededor del 70 % de la memoria total: con 64 GB, unos 45 GB útiles.

¿Es mejor una gráfica NVIDIA o AMD para IA local?+

NVIDIA tiene el soporte más amplio gracias a CUDA y casi todo funciona a la primera. AMD funciona cada vez mejor con herramientas como Ollama o LM Studio, pero conviene comprobar la compatibilidad de tu modelo de gráfica.

Te puede interesar