¿Cuánta VRAM necesita Llama 3.1 70B?
Llama 3.1 70B tiene 70.6 mil millones de parámetros. Lo que eso cuesta en memoria de GPU depende por completo de la cuantización con la que lo ejecutes.
38.7 GB
Ejecutando Q4 con un contexto de 4K tokens, que es lo que usa la mayoría.
VRAM según la cuantización
| Cuantización | Pesos | Caché KV | Total |
|---|---|---|---|
| F16 | 131.5 GB | 1.3 GB | 133.3 GB |
| Q8 | 65.8 GB | 1.3 GB | 67.5 GB |
| Q5 | 45.2 GB | 1.3 GB | 47.0 GB |
| Q4 | 37.0 GB | 1.3 GB | 38.7 GB |
Las cifras son para un contexto de 4K tokens. La caché KV crece de forma lineal con el contexto, y por eso un modelo que entra holgado en 4K puede dejar de caber en 32K sin que los pesos cambien nada.
Gráficas donde cabe en Q4
Radeon PRO W790048 GB
RTX 6000 Ada48 GB
RTX A600048 GB
A100 PCIe80 GB
H100 PCIe80 GB
M2 Max96 GB
De menor a mayor. La tarjeta más barata donde el modelo entra es más útil que la más grande donde también entra.
Otro contexto, otra cifra
Esta página fija el contexto en 4K. Ajusta tu contexto y cuantización y la calculadora recalcula el desglose completo.
Abrir la calculadora