Hong et al. (2026): a cadeia de raciocínio de modelos de 8 a 9 bilhões de parâmetros alinha-se ao cálculo interno com F1 macro de apenas 0,45 a 0,76
HONG, Yihuai; RAVFOGEL, Shauli; ZHAO, Chen; CHOI, Eunsol. Making LLMs say what they think: measuring and improving CoT-interpretability alignment. arXiv, 2026. Depósito arXiv:2609.38972 [cs.CL], versão 1, de 30 set. 2026. Preprint em avaliação. DOI: 10.48550/arXiv.2609.38972.
Os autores propõem a CIA (CoT-Interpretability Alignment), métrica da concordância entre a estratégia declarada na cadeia de raciocínio (chain of thought, CoT) e a estratégia que sondas lineares e outras ferramentas de interpretabilidade detectam nas representações internas do modelo, calculada como F1 macro entre os dois indicadores binários, e não como proporção de casos concordantes (p. 3). Testam três tarefas, perguntas factuais de dois saltos, sugestões enganosas no MMLU e multiplicação de dois dígitos, em Llama3.1-8B-Instruct, Qwen3-8B e Gemma2-9B-it, e obtêm CIA entre 0,448 e 0,759 (p. 6, Tabela 1). Maior acurácia não implica maior CIA: nas perguntas de dois saltos, o modelo mais acurado, o Gemma2, é o menos fiel (p. 6). No MMLU com sugestão, quando a dica determina a resposta, a CoT do Llama e a do Gemma a reconhecem em apenas 23,1% a 28,6% dos casos (p. 6). No pós-treinamento, a amostragem com rejeição conserva as respostas cuja CoT coincide com a sonda, e o DPO e o GRPO usam como recompensa a acurácia somada a essa coincidência (p. 7); a CIA melhora com significância (p < 0,05) em 25 das 27 células, sem queda de acurácia superior a 0,015 nas duas tarefas de conhecimento (p. 7, Tabela 2). A análise de transições e as intervenções causais indicam dois mecanismos: na multiplicação, o modelo passa a calcular de fato como escreve; nas outras duas tarefas, passa a relatar melhor o que já fazia (p. 8-9).
Interessa-me o resultado como alerta para o dever de fundamentação diante de decisão automatizada. Se a explicação escrita por um modelo pode divergir do que o produziu, ela não prova o caminho percorrido, e tratá-la como motivação equivale a aceitar um relato sem verificação. Essa leitura é interpretação nossa e não conclusão dos autores, que tratam de monitorabilidade e confiança, sem referência a direito. O segundo achado merece cautela especial: em duas das três tarefas a melhora da CIA vem de o modelo relatar melhor, com cálculo interno estável (p. 9), de modo que uma explicação mais coerente não garante raciocínio diferente. Os limites são claros. O núcleo dos experimentos usa modelos de 8 e 9 bilhões de parâmetros, com extensão a um Qwen3 de 14 bilhões numa única tarefa e a modelos de raciocínio só no MMLU (p. 25-28); as tarefas são básicas e isoladas; e os autores afirmam que a validade depende de ferramentas de interpretabilidade que ainda não recuperam o raciocínio interno com perfeição (p. 10). A acurácia das sondas em dados retidos ficou entre 0,83 e 0,91 (p. 6), e, no MMLU, quem diz se a CoT reconheceu a dica é outro modelo, o Qwen3-32B, como juiz (p. 5). O corpus não tem decisões nem peças jurídicas, apenas questões de múltipla escolha do MMLU, uma delas sobre desapropriação (p. 4), e o raciocínio longo fica para trabalho futuro (p. 10).
Texto integral: arXiv:2609.38972, na fonte
Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.