Inferencia LLM
Estimador de Velocidad.
Selecciona un modelo LLM, formato de cuantización y GPU para estimar la velocidad de generación de tokens en tiempo real. Basado en ancho de banda de memoria — el verdadero cuello de botella de la inferencia autorregresiva.
1. Selecciona el Modelo LLM
Selecciona una familia de modelos
2. Cuantización
3. Selecciona la GPU
Selecciona una marca de GPU
Configura tu estimación
Selecciona un modelo, cuantización y GPU para ver la velocidad de generación de tokens estimada.
Preguntas frecuentes
add¿Qué determina realmente los tokens por segundo?
El ancho de banda de memoria, mucho más que la potencia de cálculo. Generar cada token exige leer de memoria todo el modelo activo, así que la velocidad a la que una tarjeta mueve datos es el techo. Por eso dos tarjetas con cálculo parecido pueden diferir mucho si una tiene memoria bastante más rápida.
add¿Por qué mi tarjeta va más lenta que la estimación?
Casi siempre porque parte del modelo no está en ella. En cuanto los pesos se desbordan a la memoria del sistema, el ritmo se desploma. Otras causas habituales son un contexto largo, un runtime que cae a una ruta no optimizada, y límites térmicos o de potencia en un chasis pequeño.
add¿Puedo ejecutar un modelo solo con el procesador?
Puedes, y con modelos pequeños es perfectamente usable. La memoria del sistema es varias veces más lenta que la de una gráfica, así que espera tokens por segundo de un solo dígito en cualquier modelo de tamaño: bien para trabajo por lotes, frustrante para conversar.
add¿La cuantización acelera la generación además de ahorrar memoria?
Sí, y por el mismo motivo por el que ahorra memoria: hay menos datos que leer por token. Pasar de 16 a 4 bits suele dar una mejora grande de velocidad en el mismo hardware, además de permitir que quepa un modelo mayor.
add¿Cuántos tokens por segundo son suficientes?
Se lee a unos 5 a 10 tokens por segundo, así que por encima de 15 la conversación se siente inmediata. Por debajo de 5 resulta incómodo quedarse mirando, aunque sigue valiendo para trabajo que dejas corriendo.
Sigue explorando
Otras herramientas y páginas de referencia que continúan donde esta termina.