LLM-as-judge
Uso de um modelo de linguagem como método de pontuação dentro de uma eval, sobretudo quando a tarefa admite várias respostas válidas e a rubrica envolve qualidade semântica, utilidade ou adequação. O juiz pode atribuir score, comparar duas respostas ou classificar erros, mas continua sendo um componente do protocolo de avaliação.
O modelo julgador herda vieses de posição, estilo e preferência de modelo, além de variar com prompt e versão. Rubricas claras, ordem aleatorizada, amostra anotada por especialistas e meta-avaliação medem se o juiz concorda com o critério humano relevante. Casos determinísticos continuam melhor atendidos por validadores exatos.