Lyu (2026): juízes de modelo de linguagem acertam a ordem das respostas e erram a escala, com aceitação estimada entre 3,0% e 97,9%

Estado da arte em IA
Método de pesquisa
Auditoria de 33 configurações de juízes automáticos sobre 4.501 avaliações de trabalhadores: a ordenação das respostas concorda razoavelmente, mas a taxa de aceitação estimada varia de 3,0% a 97,9%, contra 61,1% dos trabalhadores.

LYU, Harry; THOMPSON, Neil. Right order, wrong scale: auditing LLM judges for occupational AI measurement. arXiv, 2026. Depósito arXiv:2610.02492 [cs.AI], versão 1, de 1 out. 2026. DOI: 10.48550/arXiv.2610.02492.

Lyu e Thompson, do MIT, montam o ONET-BENCH a partir de 45.796 avaliações de trabalhadores sobre respostas de IA a tarefas ocupacionais, colhidas em levantamento anterior de Mertens et al. (2026), e auditam 33 configurações preexistentes de LLM-as-a-judge* em 4.501 avaliações de teste (p. 1-3). Vinte e cinco configurações alcançam acurácia pareada, com tratamento de empates, de ao menos 0,60 (p. 5), e uma regressão TF-IDF treinada só sobre o texto da resposta chega a 0,643, contra 0,658 do melhor juiz (p. 6). A escala, porém, destoa: os juízes consideram aceitáveis de 3,0% a 97,9% das respostas, ao passo que os trabalhadores fazem 61,1% (p. 7). O Claude Opus 4.7 tem viés médio de -3,23 pontos na escala de nove, e o juiz de viés quase nulo (GPT-OSS pontual, +0,12) ainda superestima a aceitação em 17,3 pontos percentuais (p. 6). Numa linhagem ajustada por LoRA, trocar o protocolo pontual pelo pacote de poucos exemplos com avaliação em lista elevou a correlação de Spearman no nível da resposta de 0,214 para 0,263 e reduziu a correlação com as médias dos trabalhadores, no nível da ocupação, de 0,254 para 0,087, resultado replicado na validação segundo critérios fixados antes da execução (p. 8-9; Tabela 8, p. 19). A calibração isotônica elimina o viés médio, mas o R² validado cruzadamente não passa de 0,085, e a estimação assistida por predição rende, no máximo, ganhos pequenos de precisão (p. 8; Tabela 11, p. 22).

A conclusão conversa com a tese que desenvolvo: concordância de ordenação, assim como acurácia agregada de uma extração, não garante a validade da quantidade que depois se reporta. Os autores mostram isso por uma invariância simples, pois transformações afins por tarefa preservam toda a ordenação interna e movem as médias livremente (p. 5), e mostram também, num exercício exploratório restrito ao próprio rol de juízes, que escolher o juiz por acurácia pareada produziu erro médio de 10,5 pontos percentuais na taxa de aceitação, contra 5,8 quando a escolha mira diretamente esse erro (p. 7). A transposição à minha pesquisa é interpretação minha e não do trabalho: se um modelo extrai campos de acórdãos do STJ e do CARF, a medida de seleção deve ser a do campo e do resultado que o processo efetivamente consumirá, e não uma pontuação global. Na advocacia, e também por leitura minha, um juiz automático usado para triar peças ou precedentes e validado apenas por ranking pode inflar ou deprimir a taxa de aprovação sem aviso. Quanto aos limites, o corpus reúne textos em inglês, tarefas de ocupações americanas e uma só nota por resposta, de modo que, como reconhecem os autores, não se separa erro do juiz de erro do trabalhador (p. 9), e a confiabilidade das médias por ocupação é baixa, com estimativa de Spearman-Brown de 0,093 (p. 5). A reversão vale para uma linhagem e um pacote de protocolo (p. 9). O trabalho não examina direito brasileiro nem texto em português, e a transposição teria de ser testada nesse terreno.

Texto integral: arXiv:2610.02492, na fonte

Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.