← Voltar ao glossário

Transformer

Arquitetura neural para sequências baseada em mecanismos de atenção e redes feed-forward, introduzida em 2017 sem recorrência ou convolução como estrutura central. Self-attention permite que cada posição combine informação de outras posições; informação posicional preserva ordem, enquanto conexões residuais e normalização sustentam o treinamento em profundidade. Variantes podem usar encoder, decoder ou ambos.

Durante o treino, posições de uma sequência podem ser processadas em paralelo com mais eficiência que em arquiteturas recorrentes. A atenção padrão cresce quadraticamente com o comprimento do contexto, e a geração autoregressiva de modelos decoder-only ainda produz tokens sequencialmente. Transformer descreve a arquitetura; o termo não implica por si só que o modelo seja grande, generativo ou treinado como chatbot.