Ye (2026): com o corpus de treino à mostra, fatos raros ficam codificados (84%) mas pouco expressos (54%), e a autoverificação do modelo de 32B cai a cerca de 50% sobre o que ele não viu

Estado da arte em IA
Método de pesquisa
O LUMOS usa o OLMo 2, de corpus aberto, para cruzar exposição ao treino e comportamento, e mostra que a acurácia sobre conteúdo não visto fica abaixo de 44% mesmo no modelo de 32 bilhões de parâmetros, sem que escala ou raciocínio em cadeia corrijam a autoavaliação.

YE, Seoyeon; KIM, Gayoung; HONG, Jiyoung; KIM, Sookyung; CHO, Hyunsoo. LUMOS: tracing parametric knowledge from training data to behavioral outputs in LLMs. arXiv, 2026. Depósito arXiv:2610.02902 [cs.AI], versão 1, de 2 out. 2026. Trabalho aceito na 40th Conference on Neural Information Processing Systems (NeurIPS 2026), Track on Evaluations and Datasets. DOI: 10.48550/arXiv.2610.02902.

O trabalho introduz o LUMOS, arcabouço que liga o corpus de treino, as representações internas, as probabilidades e a resposta do modelo, aproveitando que o OLMo 2 (7B, 13B e 32B) publica seus dados de treino (p. 1-3). Cruza a exposição, visto ou não visto no corpus, com a correção da resposta, e estratifica as entidades factuais por frequência, com a cauda formada por entidades que aparecem uma única vez (p. 5). Nas entidades de cauda, a acurácia comportamental vai de 53,64% (7B) a 68,23% (32B), enquanto a sonda linear do 7B atinge 84,29% (p. 7, Tabela 4), o que os autores atribuem a uma falha em recuperar conhecimento já codificado. Na autoverificação, o 32B chega a 83,76% sobre conteúdo visto (acadêmico) e fica entre 53,48% e 54,77% sobre o não visto (p. 7, Tabela 3); no 7B, a acurácia aparentemente maior sobre o não visto vem com precisão e revocação abaixo de 16% (p. 8). O raciocínio em cadeia (chain-of-thought) mantém o 32B em 48,98% e 49,87% nesses conjuntos e infla a probabilidade normalizada do 7B no RealTimeQA de 28,18% para 52,83%, enquanto a acurácia passa de 33,88% a 31,74% (p. 8; Tabela 2, p. 6; Tabelas 5 e 6, p. 8). A acurácia sobre conteúdo não visto permanece abaixo de 44% no 32B (p. 8). No raciocínio matemático, o RLVR já supera o ajuste supervisionado nos conjuntos não vistos no 7B e a vantagem se estreita no 32B (p. 9, Tabela 7); em código, não há vantagem consistente (p. 18).

O que me interessa é a ideia de que o acerto de saída, sozinho, não diz se o modelo sabe, memorizou ou adivinhou, o que converge com a tese de que acurácia agregada não implica idoneidade decisória. Se decisões do STJ e do CARF integram ou não o corpus de treino de um modelo comercial é, em regra, desconhecido, e o trabalho mostra que, quando isso se pode saber, a resposta muda a leitura do desempenho. Anoto como leitura minha e não dos autores que a conferência de citações de jurisprudência geradas por modelo exige fonte primária, já que a autoverificação do maior modelo testado sobre o que não viu fica perto do acaso. Os limites estão no próprio texto: só se analisam modelos de corpus aberto, o que restringe a aplicação a modelos proprietários, e a exposição é medida por correspondência exata de cadeias de caracteres, sem captar paráfrase ou conhecimento indireto (p. 13). Soma-se que o conjunto não visto foi filtrado para reter apenas perguntas que o modelo nunca acertou em onze tentativas abertas (p. 5), o que condiciona a leitura do colapso da autoverificação. As questões são de conhecimento geral e de matemática escolar, sem texto jurídico nem português.

Texto integral: arXiv:2610.02902, na fonte

Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.