Barrie, Palaiologou e Törnberg (2026): medir a estabilidade de um prompt
BARRIE, Christopher; PALAIOLOGOU, Elli; TÖRNBERG, Petter. Prompt stability scoring for text annotation with large language models. Ithaca: arXiv, 2026. Preprint, arXiv:2407.02039v3 [cs.CL]. DOI: 10.48550/arXiv.2407.02039.
A ideia é simples e resolve um problema prático. Se o mesmo comando é executado trinta vezes sobre os mesmos textos, cada execução funciona como um avaliador distinto, e a concordância entre elas pode ser medida pelo alfa de Krippendorff, coeficiente consagrado na análise de conteúdo. O mesmo vale para variantes parafraseadas do comando, que testam a fragilidade da anotação à redação escolhida por outro pesquisador. Os autores distribuem uma implementação em Python.
Este é o trabalho de origem da métrica que uso na tese, e o que dele aproveito é o núcleo inteiro. A transposição para o Direito em português exige três adaptações, e nenhuma delas é enfrentada pelos autores, que trabalham apenas com corpora em inglês. A geração de variantes terá de recorrer a parafraseador treinado em português, a minha unidade de anotação é o conjunto de campos extraídos de cada julgado, e o acórdão do CARF é ordens de grandeza mais longo do que os textos que eles testaram.
Nota escrita a partir da leitura integral do trabalho, com assistência de modelo de linguagem na redação e revisão do autor.