Quantização
Técnica que representa pesos e, em alguns desenhos, ativações com precisão numérica menor que a usada originalmente. O mapeamento costuma empregar escalas, zero-points e granularidade por tensor, canal ou grupo. Menos bits reduzem armazenamento e tráfego de memória; kernels e hardware compatíveis podem converter essa redução em maior throughput e menor latência.
Post-training quantization aplica a conversão depois do treino, enquanto quantization-aware training simula seus efeitos durante o treinamento. O trade-off envolve erro de quantização, qualidade por tarefa, memória, energia e suporte real do runtime. Um arquivo menor não garante inferência mais rápida quando o hardware precisa desquantizar valores ou carece de kernels eficientes. Destilação comprime conhecimento por treinamento; quantização altera a representação numérica.