CuantizaciónQuantization
Hacer más grueso el redondeo de los números para aligerar el modelo
- La cuantización es redondear los números de un modelo hacia una escala más gruesa. La cantidad de números no cambia, solo se reduce cuántos dígitos ocupa cada uno.
- Con menos dígitos, baja el peso, baja el tiempo de transferencia y el cálculo se acelera. Es el truco que permite correr IA en un portátil o en un teléfono normal.
- A cambio, se difuminan las diferencias finas. Decisiones que iban muy ajustadas empiezan a tambalear, y los errores se acumulan cuanto más larga es la respuesta.
- Cuánto reducir es una elección: reducir poco casi no se nota, y reducir mucho hace que la respuesta se derrumbe de forma evidente.
- Es distinta de la poda, que elimina las conexiones que no se usan. La cuantización no descarta ni un solo número.
Contenido
1La analogía
La balanza de una tienda de comida preparada marca hasta el gramo. Doscientos gramos de esto, cuatrocientos ochenta y siete de aquello. Con un centenar de recipientes, hacen falta un centenar de números en el registro. Los dígitos son largos, cuesta anotarlos y el cuaderno se llena rápido.
Entonces se hace más gruesa la escala de la balanza. Se pesa solo en unidades de cien gramos, y lo que cae entre dos marcas se redondea hacia la más cercana. Trescientos doce gramos pasan a trescientos, y cuatrocientos ochenta y siete pasan a quinientos. Los números se acortan, el cuaderno se adelgaza y sumar el total se hace más rápido.
Claro que el peso queda un poco desviado. Aun así, se puede saber casi igual de bien qué recipiente pesa más o cuánta comida se vendió hoy. La cuantización es justo eso: hacer más gruesa la escala.
2En detalle
La cantidad no cambia, solo se reducen los dígitos
Dentro de un modelo hay miles de millones de números que quedaron fijados durante el entrenamiento. Normalmente se guardan con muchos decimales, en un formato generoso. Así se pueden captar diferencias muy finas, pero cada número ocupa bastante espacio.
La cuantización traslada esos números a una escala más gruesa. El valor que cae entre dos marcas se redondea a la marca más cercana. Ningún número desaparece ni se corta ninguna conexión. La cantidad de casillas de la tabla sigue igual; lo que se acorta es el número escrito dentro de cada casilla.
Reducir el espacio a la mitad reduce el peso a más o menos la mitad. Reducirlo a un cuarto también es habitual. Un modelo de diez y tantos gigabytes que baja a cuatro o cinco gigabytes se convierte, a partir de ahí, en algo que puede correr en un ordenador personal.
Dónde se coloca la escala marca la diferencia
Al hacer más gruesa la escala hay que decidir en qué rango se extiende. La mayoría de los números se concentran cerca de cero, y si la escala se estira hasta valores muy grandes, justo esa zona cercana a cero, la que más importa, termina aplastada dentro de una sola marca.
Por eso se fija un intervalo de escala distinto por capa, o incluso por fila. También se usa el método de dejar aparte, en su formato original, a la pequeña cantidad de números que se disparan mucho, y reducir solo el resto. Con la misma cantidad de dígitos, la calidad del resultado puede variar bastante según qué tan bien se haga este ajuste.
A veces se pasa un pequeño conjunto de datos de prueba para medir de verdad dónde se concentran los valores, y con eso se ajusta la escala. No se vuelve a entrenar, solo se ajusta la escala, así que el proceso toma de minutos a algunas horas.
Por qué la IA corre en portátiles y teléfonos
Al correr un modelo, lo que más tiempo consume no es el cálculo en sí, sino traer los números desde la memoria. Con menos dígitos, en el mismo tiempo se puede transportar una cantidad mayor de números. Por eso la velocidad de respuesta mejora de forma notable.
También cambia si el modelo cabe entero en la memoria gráfica o no. Si no cabe, hay que ir cambiando fragmentos todo el tiempo, y eso hace caer mucho la velocidad. El chat de IA que corre dentro del navegador, el traductor que funciona sin internet y las funciones de organizar fotos del teléfono son, en su mayoría, modelos con la escala reducida.
También hay que saber qué se pierde
Ser más liviano tiene un precio. El redondeo desvía un poco cada valor respecto al original, y esa desviación se va acumulando capa tras capa. Escribir una sola línea de respuesta ya pasa por decenas de capas, así que una diferencia invisible al principio se hace notoria más adelante.
Se nota especialmente en decisiones que iban muy ajustadas. Cálculos largos, código donde un solo carácter mal cambia todo el resultado, o respuestas muy extensas: ahí es donde más se nota. En cambio, en una conversación liviana o un resumen, suele ser difícil notar la diferencia.
Es un método distinto de la poda
Como también aligera el modelo, se la menciona a menudo junto con la poda, pero hacen cosas distintas. La cuantización no descarta ni un solo número: los deja todos, y solo hace más grueso el formato con que se anotan. La poda, al revés, elimina directamente las conexiones que no se usan y reduce la cantidad.
No se estorban entre sí, así que a veces se usan juntas: primero se quitan las conexiones que no se usan para reducir la cantidad, y después se hace más gruesa la escala de los números que quedan.
3Con más precisión
La cuantización traslada los pesos y los valores intermedios, guardados en coma flotante, a una representación de enteros con menos bits. El rango de valores se expresa mediante un intervalo de escala y un punto de referencia, y el valor original se asigna a la marca más cercana. Hay una forma que se aplica después de terminado el entrenamiento, y otra que entrena desde el inicio asumiendo ya esa escala más gruesa.
La analogía también tiene sus límites. La escala de la balanza mantiene el mismo intervalo de principio a fin, pero la cuantización real mide en qué rango se concentran los valores capa por capa y fija intervalos distintos para cada una. Además, el peso de la comida termina su error en el momento de pesar, pero los números de un modelo se convierten en la entrada de la siguiente capa, así que la desviación se va transmitiendo hacia adelante. También existe el método de reducir solo al guardar y volver al formato original al calcular, con lo que baja el peso pero apenas mejora la velocidad. Sea cual sea el método, después de reducir hay que volver a evaluar cuánto se alteró el resultado.
4Pruébalo
- WebLLM Chat (chatbot de IA que corre en el navegador) ailearn.space Es un modelo que corre en el navegador sin instalar nada. Se nota que baja la precisión permite que quepa en un portátil normal
- Netron (visor de arquitecturas de modelos) ailearn.space Abre un archivo de modelo y busca en cada capa con cuántos bits se guarda cada número
5Malentendidos comunes
Es fácil pensar que cuantizar vuelve tonto al modelo, pero en realidad, hasta un nivel razonable, es difícil notar la diferencia en una conversación cotidiana.
Es fácil pensar que la cuantización recorta una parte del modelo, pero en realidad no descarta ningún número, solo reduce los dígitos con los que se anota.
Es fácil pensar que si baja el peso, la velocidad siempre mejora, pero en realidad, si al calcular se vuelve al formato original, la ganancia de velocidad es casi nula.
7Resumen en una línea
En resumenLa cuantización hace más gruesa la escala de los números de un modelo, a cambio de espacio y velocidad, y cede a cambio un poco de precisión fina.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02