Benchmark de IA
Conjunto versionado de tarefas, dados, protocolo de execução e métricas usado para comparar modelos ou sistemas sob as mesmas condições. O número publicado só tem sentido junto da população avaliada, da configuração de inferência, do método de pontuação e da versão do benchmark. Alterar qualquer uma dessas partes muda o contrato de comparação.
Benchmarks públicos favorecem comparabilidade, mas podem estar distantes do tráfego real ou contaminados nos dados de treino. Um benchmark interno precisa cobrir segmentos, casos limítrofes e falhas com consequência operacional, preservando um conjunto estável para regressão. Combinar métricas complementares reduz pontos cegos; resultado agregado sem distribuição de erros pode esconder exatamente o grupo em que o sistema falha.