Glosario de IA
Cuantización
Guardar los pesos de un modelo con menos bits para que ocupe menos memoria y vaya más rápido, a costa de perder un poco de calidad.
Los pesos suelen entrenarse como números de 16 o 32 bits. La cuantización los convierte a 8, 4 o incluso menos bits. Así, un modelo que necesitaba una GPU de centro de datos puede caber en un portátil o un móvil.
Es muy habitual para ejecutar en local modelos de pesos abiertos. Cuanto más agresiva, más memoria ahorra pero más empeoran las respuestas, así que prueba el equilibrio para tu caso.
Ejemplo: Un modelo de 8.000 millones de parámetros ocupa unos 16 GB con 16 bits por peso. Cuantizado a 4 bits baja a unos 4 o 5 GB y cabe en un portátil con poca memoria.
En la práctica
- Para usar modelos en local, 4 u 8 bits suelen ser un buen equilibrio; por debajo, la calidad cae más.
- Compara la versión cuantizada con la original en tus propias tareas.
- Si usas una API, el proveedor se encarga de esto: solo importa cuando ejecutas modelos en tu equipo.