LLM Hardware Tool

VRAM
Calculator.

Selecciona un modelo de lenguaje, cuantización y longitud de contexto para calcular exactamente cuánta VRAM necesita tu GPU.

VRAM Requerida

5.21GB

Desglose

Pesos del modelo4.21 GB
KV Cache (ctx 4,096)0.50 GB
Overhead runtime0.50 GB
Total estimado5.21 GB

GPU Recomendada

RTX 5060 8GB

8GB VRAM — Corre en local

shopping_cart Ver GPU en Amazon
check_circle

Mínimo recomendado: RTX 4060

Estimación basada en Ollama / llama.cpp. Resultados pueden variar según framework.

article

¿Nuevo en LLMs locales?

Lee nuestra guía completa sobre cómo correr modelos en tu PC con Ollama.

Modelo

DeepSeek R1 1.5Bctx 131K
1.78Bparams
DeepSeek R1 7Bctx 131K
7.6Bparams
DeepSeek R1 8Bctx 131K
8.03Bparams
DeepSeek R1 14Bctx 131K
14.7Bparams
DeepSeek R1 32Bctx 131K
32.5Bparams
DeepSeek R1 70Bctx 131K
70.6Bparams
Falcon 40Bctx 2K
40Bparams
Falcon 180Bctx 2K
180Bparams
Gemma 1 2Bctx 8K
2Bparams
Gemma 2 2Bctx 8K
2.6Bparams
Gemma 1 7Bctx 8K
7Bparams
Gemma 2 9Bctx 8K
9.24Bparams
Gemma 2 27Bctx 8K
27.2Bparams
Llama 3.2 1Bctx 131K
1.24Bparams
Llama 3.2 3Bctx 131K
3.21Bparams
Llama 1 7Bctx 2K
7Bparams
Llama 2 7Bctx 4K
7Bparams
Llama 3 8Bctx 8K
8Bparams
Llama 3.1 8Bctx 131K
8.03Bparams
Llama 2 13Bctx 4K
13Bparams
Llama 4 Scout 17Bctx 131K
17Bparams
Llama 1 33Bctx 2K
33Bparams
Llama 1 65Bctx 2K
65Bparams
Llama 2 70Bctx 4K
70Bparams
Llama 3.3 70Bctx 131K
70Bparams
Llama 3 70Bctx 8K
70Bparams
Llama 3.1 70Bctx 131K
70.6Bparams
Llama 3.1 405Bctx 131K
405Bparams
Mistral 7B v0.1ctx 8K
7Bparams
Mistral 7B v0.3ctx 33K
7.24Bparams
Mistral Nemo 12Bctx 131K
12.2Bparams
Mixtral 8x7Bctx 33K
46.7Bparams
Mixtral 8x22Bctx 66K
141Bparams
Phi-2 2.7Bctx 2K
2.7Bparams
Phi-3.5 Mini 3.8Bctx 128K
3.8Bparams
Phi-3 Mini 3.8Bctx 128K
3.8Bparams
Phi-4 14Bctx 16K
14Bparams
Qwen 2.5 0.5Bctx 131K
0.5Bparams
Qwen 2.5 1.5Bctx 131K
1.5Bparams
Qwen 2.5 3Bctx 131K
3.1Bparams
Qwen 2 7Bctx 131K
7Bparams
Qwen 2.5 7Bctx 131K
7.6Bparams
Qwen 2.5 Coder 7Bctx 131K
7.6Bparams
Qwen 1.5 14Bctx 33K
14Bparams
Qwen 2.5 14Bctx 131K
14.7Bparams
Qwen 2.5 Coder 32Bctx 131K
32.5Bparams
Qwen 2.5 32Bctx 131K
32.5Bparams
Qwen 2 72Bctx 131K
72Bparams
Qwen 2.5 72Bctx 131K
72.7Bparams
Yi 34Bctx 200K
34Bparams

Cuantización

F32
starstarstarstarstar
Máxima calidad. Solo para research.
F16
starstarstarstarstar
Sin pérdida notable. Fine-tuning e inferencia.
Q8
starstarstarstarstar_border
Casi idéntica a F16, mitad de VRAM.
Q6
starstarstarstarstar_border
Pérdida mínima. Buen balance.
Q5
starstarstarstar_borderstar_border
Recomendada si tienes VRAM suficiente.
PopularQ4
starstarstarstar_borderstar_border
La más usada. Mejor balance VRAM/calidad.
Q3
starstarstar_borderstar_borderstar_border
Pérdida notable. Usa solo si necesario.
Q2
starstar_borderstar_borderstar_borderstar_border
Pérdida severa. Último recurso.
SeleccionadaQ4_K_M — Popular
Bits/peso4.5
CalidadAceptable

Contexto

Longitud de contexto

VRAM según el modelo

Preguntas frecuentes

add

¿Cuánta VRAM necesita un modelo de lenguaje?

Aproximadamente el número de parámetros por los bytes de cada parámetro, más el contexto. Un modelo de 7000 millones a 4 bits necesita unos 4 GB, a 8 bits unos 7 GB y en precisión completa de 16 bits unos 14 GB. Uno de 70B a 4 bits ronda los 40 GB, fuera del alcance de cualquier tarjeta de consumo.

add

¿Qué me cuesta realmente la cuantización?

Guarda cada peso en menos bits, así que el modelo encoge más o menos en proporción. Pasar de 16 a 8 bits es casi gratis en calidad; 4 bits es el punto habitual de equilibrio y la pérdida es pequeña para la mayoría de usos; por debajo de 4 bits la degradación se nota.

add

¿Puedo poner una segunda gráfica para que quepa un modelo mayor?

Sí: las capas se reparten entre tarjetas y las capacidades suman, así que dos tarjetas de 16 GB pueden alojar un modelo de 30 GB. Cuenta con perder algo por el tráfico entre ellas, y ten en cuenta que la tarjeta más lenta marca el ritmo.

add

¿Qué pasa si el modelo no cabe?

Lo que no cabe se desborda a la memoria del sistema, y esa parte funciona a una fracción de la velocidad, porque la memoria del procesador es mucho más lenta que la de la tarjeta. Un modelo que cabe casi entero es usable; uno que casi no cabe, no.

add

¿Un contexto más largo consume más memoria?

Sí, y se olvida constantemente. La caché de atención crece con el número de tokens en juego, y con contextos largos puede ocupar más que los propios pesos del modelo. Dimensiona para el contexto que piensas usar, no para el más pequeño.

Sigue explorando

Otras herramientas y páginas de referencia que continúan donde esta termina.