Métricas de Avaliação de NLP
Família de instrumentos usados para comparar uma saída textual com uma ou mais referências. BLEU privilegia precisão de n-grams com penalidade para respostas curtas; ROUGE cobre variantes orientadas a sobreposição e recall; METEOR alinha termos com recursos como stemming e sinonímia; Exact Match exige igualdade segundo uma normalização declarada. Esses sinais são rápidos, determinísticos e úteis quando forma e conteúdo esperado são restritos.
Tarefas abertas admitem paráfrases válidas e respostas semanticamente corretas com pouca sobreposição lexical. Métricas por embeddings, BERTScore e avaliadores baseados em modelos ampliam a sensibilidade semântica, com mais custo, variância e dependência do avaliador. A escolha deve seguir o modo de falha: sinais lexicais para exatidão e regressão barata, sinais semânticos para significado e revisão humana para calibrar o critério. Nenhuma métrica isolada constitui uma eval.