¿Cuánta VRAM necesita Llama 3.2 3B?
Llama 3.2 3B tiene 3.21 mil millones de parámetros. Lo que eso cuesta en memoria de GPU depende por completo de la cuantización con la que lo ejecutes.
2.6 GB
Ejecutando Q4 con un contexto de 4K tokens, que es lo que usa la mayoría.
VRAM según la cuantización
| Cuantización | Pesos | Caché KV | Total |
|---|---|---|---|
| F16 | 6.0 GB | 0.4 GB | 6.9 GB |
| Q8 | 3.0 GB | 0.4 GB | 3.9 GB |
| Q5 | 2.1 GB | 0.4 GB | 3.0 GB |
| Q4 | 1.7 GB | 0.4 GB | 2.6 GB |
Las cifras son para un contexto de 4K tokens. La caché KV crece de forma lineal con el contexto, y por eso un modelo que entra holgado en 4K puede dejar de caber en 32K sin que los pesos cambien nada.
Gráficas donde cabe en Q4
RTX 308010 GB
RTX 306012 GB
RTX 4070 Super12 GB
RTX 507012 GB
RX 6900 XT16 GB
RX 7800 XT16 GB
De menor a mayor. La tarjeta más barata donde el modelo entra es más útil que la más grande donde también entra.
Otro contexto, otra cifra
Esta página fija el contexto en 4K. Ajusta tu contexto y cuantización y la calculadora recalcula el desglose completo.
Abrir la calculadora