← Voltar ao glossário

Evals (Avaliações de Sistemas de IA)

Processo estruturado de medir se um sistema de IA atende critérios definidos em casos representativos. Uma eval combina dataset ou cenários, resultado esperado, método de pontuação e regra de decisão. Pode avaliar qualidade, segurança, custo, latência e comportamento sob falhas, desde que cada dimensão tenha evidência observável.

A unidade correta costuma ser o sistema completo: modelo, prompt, recuperação, ferramentas, memória e interface. LLM-as-judge é um possível avaliador, não a eval inteira. Um conjunto útil precisa de baseline, versionamento, análise por segmento e casos de regressão derivados de incidentes reais.