Gultekin e outros (2025): a resposta certa pelo caminho errado
GULTEKIN, Sinan; ROSSI REICH, Matteo; GALLONI, Francesca; LAGIOIA, Francesca; CONSIGLIO, Elena; SARTOR, Giovanni; BAGNATO, Sara. A two-dimensional evaluation framework for factual and reasoning assessment of LLMs in legal question answering. In: MARKOVICH, Réka; DI CARO, Luigi; RAPP, Amon; SCHIFANELLA, Claudio (org.). Legal Knowledge and Information Systems: JURIX 2025. Amsterdam: IOS Press, 2025. p. 86-97. (Frontiers in Artificial Intelligence and Applications, v. 416). DOI: 10.3233/FAIA251579.
A proposta é avaliar a saída do modelo em dois eixos independentes. Um classifica a resposta em correta, parcial, errada ou omitida. O outro classifica a justificativa em ancorada no documento, inferida, alucinada ou incoerente. O cruzamento expõe a combinação que as métricas de eixo único registram como acerto, que é a resposta juridicamente correta obtida por raciocínio inventado.
A distinção entre inferir e alucinar incide exatamente sobre a fronteira que me importa, a que separa o que o auto de infração ou o acórdão efetivamente diz do que o modelo supõe dito. Os autores registram ainda que todos os modelos testados acertam mais ao julgar a resposta do que ao auditar a cadeia que a produziu, o que é coerente com o que venho observando.
Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.