Hu (2026): auditar o raciocínio estruturado de modelos acha erros que o juiz sobre prosa livre deixa passar

Estado da arte em IA
Método de pesquisa
Os autores obrigam o modelo a registrar o raciocínio em campos verificáveis e mostram que veredito correto não garante fundamentação correta: o juiz holístico sobre texto livre deixou de apontar 86,8% dos registros em que a auditoria estruturada achou erro.

HU, Boyue Caroline; AHIR, Kaivalya; NI, Ronghao; JIA, Limin. Correct verdicts, flawed reasoning: structured auditing of LLM-based vulnerability reasoning. arXiv, 2026. Depósito arXiv:2610.06366 [cs.CR], versão 1, de 5 out. 2026. DOI: 10.48550/arXiv.2610.06366.

Hu e colegas, da Carnegie Mellon, partem da constatação de que um veredito correto de modelo de linguagem sobre vulnerabilidade de software pode vir acompanhado de explicação fabricada. Na auditoria manual, feita por dois especialistas, das explicações de quatro modelos sobre 64 pares de função vulnerável e corrigida do SVEN, relatam que cerca de 60% dos vereditos corretos traziam alegações fabricadas ou inverificáveis (p. 1 e 4-5); as referências a conhecimento externo, como CVEs, estavam erradas em 55% a 61% das vezes, e 19% a 34% das respostas se apoiavam em afirmações sobre o comportamento de funções chamadas ou sobre convenções do projeto, ausentes do código fornecido (p. 3 e 5). Propõem o VERA, que obriga o modelo a registrar o raciocínio em quatro blocos, escopo, traço de estados, avaliação de propriedades e veredito (p. 6-7), e o submete a um juiz de oito estágios: cinco determinísticos, sobre a árvore sintática, dois com chamada a modelo, para pressupostos e alias, e um misto, para a coerência do veredito (p. 8-10). Com 851 pares de funções em cinco classes de falhas (p. 11), as taxas de erro por estágio ficaram próximas entre vereditos corretos e incorretos, com diferença máxima de 0,05 (p. 15, Tabela 6d, e p. 16), e o juiz holístico sobre prosa livre deixou de apontar 86,8% dos registros em que o VERA achou erro nos estágios determinísticos (p. 16). Todos os modelos falham na coerência entre raciocínio e veredito em 50% a 69% dos registros (p. 17). Os dois estágios dependentes de modelo tiveram revocação baixa (p. 15).

O que me interessa é a demonstração, em domínio técnico vizinho, de que acerto da conclusão não valida a fundamentação, o que dialoga com a tese de que acurácia agregada não implica idoneidade decisória. O exemplo em que o modelo invoca o CVE-2019-6974, defeito de contagem de referências e não de uso após liberação, para sustentar o veredito (p. 5) é um análogo estrutural da citação de precedente que existe, mas não se aplica à tese. A ponte com o direito é interpretação minha, porque o trabalho não trata de matéria jurídica. A meu ver, ele sugere um desenho aplicável à verificação de citações: registro estruturado com campos para dispositivo, precedente, tese e conclusão, conferência determinística da existência do julgado e modelo de linguagem reservado ao juízo semântico, como o da vinculação do precedente à tese. Os limites são, em regra, declarados pelos autores. O escopo se restringe a cinco classes de falhas de memória e de ciclo de vida de recursos em C e C++ (p. 17); a análise opera sobre trechos de código sem compilação, o que deixa de fora a detecção precisa de código morto, o alias além da atribuição direta e a alcançabilidade formal de caminhos (p. 10); e o VERA só verifica o que está registrado, de modo que registros esparsos podem inflar a taxa de raciocínio sadio (p. 17). Trata-se ainda de preprint, com código e material suplementar em repositório anônimo (p. 19). No direito, a transposição pressupõe taxonomia própria de falhas de fundamentação e definição operacional de existência e de vinculação do precedente.

Texto integral: arXiv:2610.06366, na fonte

Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.