← Voltar ao glossário

Grokking

Fenômeno de treinamento em que um modelo primeiro memoriza o conjunto de treino e permanece por muitas etapas com baixo desempenho fora da amostra, até apresentar uma melhora tardia e acentuada de generalização. A observação original apareceu em pequenos datasets de tarefas algorítmicas: a acurácia de treino já estava próxima do máximo enquanto a validação continuava perto do acaso, antes de subir muito depois.

O fenômeno mostra que ajustar os exemplos observados e aprender uma regra que generaliza podem ocorrer em momentos distintos da otimização. Ele não autoriza treinar indefinidamente qualquer modelo sobreajustado na expectativa de uma transição. Dataset, regularização, otimizador, arquitetura e tarefa alteram a dinâmica, enquanto os mecanismos explicativos continuam dependentes do regime estudado. A verificação exige curvas separadas de treino e validação, múltiplas seeds e controle contra vazamento de dados.