← Voltar ao glossário

Induction Heads

Circuitos de atenção associados ao reconhecimento e à continuação de padrões repetidos no contexto. Um comportamento canônico é observar uma sequência A seguida de B e, ao encontrar A novamente, favorecer B como continuação. Isso oferece um mecanismo interpretável para parte do in-context learning.

Há evidência causal forte em transformers pequenos e evidência correlacional em modelos maiores. Induction heads não explicam sozinhos toda a capacidade de ICL nem permitem inferir diretamente como um modelo proprietário resolveu uma tarefa. O termo pertence à interpretabilidade mecanística, onde hipóteses precisam ser testadas por intervenções no circuito.