Alviano et al. (2026): extração de fatos com ASP e gramática restrita chega a F1 entre 0,96 e 0,98, mas a melhor configuração acerta 74% das instâncias por inteiro

Estado da arte em IA
Método de pesquisa
O LLMASP deixa ao modelo de linguagem apenas a extração de fatos e entrega o raciocínio a regras escritas por especialistas; a decodificação restrita por gramática (CSV, Datalog, JSON) muda o custo e o tipo de erro, e o resultado agregado esconde instâncias que seguem imperfeitas.

ALVIANO, Mario; CAPALBO, Matteo; GOTTLOB, Georg; GRILLO, Lorenzo; KAREEM, Irfan; LO SCUDO, Fabrizio et al. Integrating answer set programming and large language models for reliable structured knowledge extraction. Journal of Artificial Intelligence Research, v. 87, art. 6, 47 p., set. 2026. DOI: 10.1613/jair.1.21678.

O artigo apresenta o LLMASP, arcabouço em que o modelo de linguagem apenas extrai fatos relacionais do texto, um predicado por chamada, e regras escritas por especialistas em Answer Set Programming (ASP) fazem o raciocínio (p. 3-4, Figura 1). Sobre 512 instâncias em 16 domínios derivados de competições de ASP (p. 17), a pontuação F1 sobe de 0,721 para 0,827 com o LLaMA 3.1 de 8 bilhões de parâmetros e de 0,892 para 0,963 com o LLaMA 3.3 de 70 bilhões, em relação à extração em chamada única com o mesmo contexto (p. 16 e 18, Tabela 2); com uma base de conhecimento em ASP que deriva parte dos fatos, os valores passam a 0,863 e 0,965. Os autores comparam ainda três gramáticas de decodificação restrita, CSV, Datalog e JSON, em 48 configurações (p. 7 e 20). No modelo de 70 bilhões, o JSON dá a maior acurácia e o menor número de fatos falsos e duplicados, ao custo de mais tokens (p. 21-23 e 28); o CSV mantém F1 de 0,966, contra 0,963 sem gramática, e reduz a energia em cerca de 20% (49,3 contra 61,4 × 10^5 J) (p. 27); o Datalog é a gramática menos confiável (p. 22). No modelo de 8 bilhões, a restrição por gramática em geral não compensa (p. 22). A análise qualitativa mostra erros concentrados em poucos domínios e, com filtros simples, o F1 do CSV vai de 0,966 a 0,980 (p. 24 e 46-47).

Para a minha pesquisa, o ponto de maior interesse é a separação entre extrair e decidir: o modelo só transcreve campos, e o que se faz com eles é determinístico. Vejo aí, por leitura minha, afinidade com a comparação contra uma linha de base sem modelo generativo para campos de acórdãos do STJ e do CARF, embora o trabalho não teste nenhuma linha de base sem modelo de linguagem. Interessa-me também a métrica de instâncias perfeitas. Com F1 de 0,963 no modelo de 70 bilhões, a taxa de instâncias extraídas sem nenhum erro é de 0,674, e o melhor valor da Tabela 3 é 0,738 (p. 21): a acurácia agregada convive com falha em um quarto ou mais dos casos, o que é o argumento da minha tese de que ela não basta para a idoneidade decisória. Os limites pesam. Os textos são gerados por modelos de frases a partir de fatos conhecidos (p. 17), em inglês e fora do direito; o pipeline completo roda só em modelos LLaMA, e o GPT-4o-mini aparece apenas como linha de base de chamada única no apêndice (p. 16 e 34); cada configuração aparece com um único valor, sem variação entre execuções, embora os autores reconheçam que a decodificação restrita continua estocástica (p. 9); e os filtros que elevam o F1 foram desenhados depois de examinar os erros do próprio conjunto (p. 46-47). A transposição ao acórdão brasileiro, de texto livre e sem gabarito gerado, é interpretação nossa e não do trabalho.

Texto integral: Alviano et al., JAIR 87, art. 6, na fonte

Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.