Marwah (2026): no Llama-3.1-8B com distrator em híndi, pontuar alucinação por correspondência exata superestima em cerca de 1,5 vez o erro semântico

Estado da arte em IA
Método de pesquisa
Cinco modelos abertos, 40.000 avaliações e uma frase irrelevante em outro idioma antes da pergunta: a taxa de alucinação do Llama-3.1-8B com distrator em híndi vai a 0,710, mas cai a 0,470 quando se separam as respostas corretas escritas no alfabeto errado.

MARWAH, Riju; GARIMELLA, Ritvik; BANSAL, Khusham; JAIN, Atishay; SHETH, Amit. Output language confusion under multilingual prompt contamination. arXiv, 2026. Depósito arXiv:2610.02926 [cs.CL], versão 1, de 2 out. 2026. DOI: 10.48550/arXiv.2610.02926.

Os autores propõem o Multilingual Distractor Interference (MDI), protocolo em que uma frase estrangeira irrelevante, que manda o modelo ignorá-la, antecede a pergunta factual em inglês. Testam cinco modelos abertos (Llama-3.1-8B, Llama-3.2-3B, Phi-3-mini, Mistral-7B e Qwen-2.5-3B) no TruthfulQA e no TriviaQA, em oito condições, num total de 40.000 avaliações (p. 1, 5). Com o distrator em híndi, o Llama-3.1-8B passa a responder em devanágari em 58,2% dos casos, e sua taxa proxy de alucinação, definida como a fração de respostas nem corretas nem abstenções, sobe de 0,416 para 0,710 (p. 4; p. 6, Tabela 3). A revisão manual dos 291 casos de troca de alfabeto mostra que, das 148 respostas que estavam corretas na condição limpa, 120 (81,1%) seguem semanticamente corretas, apenas no alfabeto errado, e a taxa semântica ajustada cai para 0,470, isto é, 235 em 500 (p. 7). Os demais modelos quase não mudam de alfabeto; no Phi-3-mini, no Mistral-7B e no Qwen-2.5-3B a abstenção sobe e a taxa proxy de alucinação cai, e no Llama-3.2-3B a variação desta não é significativa (p. 6, Tabela 3). Um parágrafo em inglês da Wikipédia provoca abstenção entre 0,424 (Llama-3.2-3B) e 0,998 (Qwen-2.5-3B) (p. 7, Tabela 4). No TruthfulQA de múltipla escolha, avaliado por log-probabilidade das alternativas, nenhuma queda de acurácia é significativa nas condições de uma só frase (p. 5).

Interessa-me porque o mecanismo é o mesmo que combato na avaliação de extração: um número agregado, aqui a taxa de alucinação por correspondência exata, mistura fenômenos de natureza distinta, e só a decomposição, aqui entre troca de alfabeto e erro semântico, permite dizer o que o modelo errou. Na minha pesquisa, a correspondência exata sobre campos extraídos de decisões do STJ e do CARF também pode confundir variação de forma, como grafia ou formatação de número de processo, com erro de conteúdo. Essa transposição é leitura minha, pois o artigo trata de perguntas factuais de cultura geral. O achado de abstenção diante de um parágrafo que não contém a resposta importa ainda a quem recupera contexto sobre acervo jurisprudencial: os autores sustentam que o modelo pode se abster mesmo tendo recuperado o trecho correto, falha que a avaliação centrada na qualidade da recuperação não enxerga (p. 8), embora o experimento, feito com trecho alheio à pergunta, não teste diretamente essa hipótese. Os autores apontam como limites o uso de cinco modelos abertos, lançados entre 2023 e 2024, um distrator que declara a própria irrelevância e a detecção de abstenção por busca de expressões, que pode perder recusas menos padronizadas (p. 9). O artigo não informa quantos revisores analisaram os 291 casos de troca de alfabeto nem a concordância entre eles, e o português não integra as línguas testadas.

Texto integral: arXiv:2610.02926, na fonte

Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.