Saltar al contenido
estudIA

Glosario de IA

Cuantización

Guardar los pesos de un modelo con menos bits para que ocupe menos memoria y vaya más rápido, a costa de perder un poco de calidad.

Los pesos suelen entrenarse como números de 16 o 32 bits. La cuantización los convierte a 8, 4 o incluso menos bits. Así, un modelo que necesitaba una GPU de centro de datos puede caber en un portátil o un móvil.

Es muy habitual para ejecutar en local modelos de pesos abiertos. Cuanto más agresiva, más memoria ahorra pero más empeoran las respuestas, así que prueba el equilibrio para tu caso.

Ejemplo: Un modelo de 8.000 millones de parámetros ocupa unos 16 GB con 16 bits por peso. Cuantizado a 4 bits baja a unos 4 o 5 GB y cabe en un portátil con poca memoria.

En la práctica

  • Para usar modelos en local, 4 u 8 bits suelen ser un buen equilibrio; por debajo, la calidad cae más.
  • Compara la versión cuantizada con la original en tus propias tareas.
  • Si usas una API, el proveedor se encarga de esto: solo importa cuando ejecutas modelos en tu equipo.

Términos relacionados

← Volver al glosario