← Voltar ao glossário

Cross-Encoder

Arquitetura que recebe query e documento juntos na mesma passagem pelo Transformer e produz um score de relevância para o par. A atenção conjunta permite modelar alinhamentos finos entre os dois textos, uma vantagem importante quando candidatos semanticamente próximos precisam ser ordenados com precisão.

Cada novo par exige inferência, portanto os documentos não podem ser totalmente pré-computados para qualquer query. O custo cresce com a quantidade de candidatos e com o comprimento das sequências, o que normalmente restringe o cross-encoder ao reranking de uma shortlist recuperada por BM25, bi-encoder ou ColBERT. Batching e truncation ajudam na latência, mas podem alterar a qualidade e precisam entrar nas evals.