Extração automatizada e tratamento semântico de decisões judiciais com inteligência artificial
Um método replicável aplicado a pesquisa de precedentes tributários do STJ
Referência
MALKO, Fábio André. Extração automatizada e tratamento semântico de decisões judiciais com inteligência artificial: um método replicável aplicado a pesquisa de precedentes tributários do STJ. 2026. 198 f. Dissertação (Mestrado Profissional em Direito) — Instituto Brasileiro de Ensino, Desenvolvimento e Pesquisa, Brasília, 2026. Orientador: Prof. Dr. Luís Felipe Perdigão de Castro. Defesa em 27 de julho de 2026.
Onde encontrar o texto integral
O trabalho está depositado em acesso aberto no repositório institucional do IDP, sob o endereço permanente https://repositorio.idp.edu.br/handle/123456789/5980, de onde se obtém o texto integral em arquivo PDF.
Resumo depositado
O texto abaixo é o resumo tal como consta do registro no repositório institucional do IDP.
Esta dissertação propõe, descreve e testa um método empírico-computacional replicável para a extração, a estruturação e a análise semântica de decisões judiciais com apoio de inteligência artificial, tomando como campo de prova o contencioso tributário estadual e municipal no Superior Tribunal de Justiça. O problema desdobra-se em dois planos: no plano substantivo, indaga-se se os tribunais de origem aplicam de modo uniforme os precedentes do Superior Tribunal de Justiça em matéria de ICMS, ISS, ITBI e ITCMD; no plano metodológico, que é o central, pergunta-se como tratar grandes volumes de decisões de forma reconstruível e acessível ao jurista, sem programação prévia e sem leitura automatizada ingênua. O corpus foi constituído a partir dos dados abertos de inteiros teores do próprio Superior Tribunal de Justiça, coletados por raspagem em Python e delimitados pelos códigos de assunto da Tabela Processual Unificada do Conselho Nacional de Justiça, no recorte de maio de 2022 a dezembro de 2025. O tratamento organizou-se em três camadas: extração determinística, análise semântica (classificação por modelo de linguagem segundo dicionário de categorias fechado) e consolidação por processo. Adotaram-se salvaguardas contra alucinação e instabilidade, além de validação humana por amostragem. Reuniram-se mais de cinquenta e oito mil decisões com inteiro teor, distribuídas em dezenas de milhares de processos únicos. Os achados indicam o predomínio dos óbices de admissibilidade no acesso ao mérito e uma variação relevante das taxas de reforma entre os tribunais de origem, compatível com a hipótese de focos desiguais de divergência, aqui designados ilhas de resistência. O produto do trabalho, próprio do mestrado profissional, é um roteiro replicável de análise de decisões em escala, transferível a outros tributos, cortes e ramos do Direito.
Síntese
O trabalho parte de um problema prático de quem pesquisa contencioso tributário em escala. A consulta jurisprudencial convencional recupera decisões uma a uma e não permite afirmar nada sobre a distribuição dos fundamentos, dos óbices de admissibilidade ou dos focos de divergência no conjunto. A extração assistida por modelo de linguagem promete resolver isso, e traz consigo um risco próprio, que é a produção de campos plausíveis sem correspondência no texto de origem.
O método desenvolvido percorre coleta, extração determinística, classificação semântica e consolidação, e foi desenhado para ser executável por jurista sem formação prévia em programação. O corpus reuniu 62.383 decisões únicas do Superior Tribunal de Justiça em ICMS, ISS, ITBI e ITCMD, entre maio de 2022 e dezembro de 2025, das quais 58.460 foram classificadas.
A validação foi adjudicada sobre 401 decisões, com critério de aprovação fixado no limite inferior do intervalo de confiança de 95% igual ou superior a 0,75, e quatro dos dez campos passaram nesse critério. O achado que interessa ao método está na dispersão entre eles: a multa alcançou 0,97 de concordância, e o precedente determinante ficou em 0,17, no mesmo corpus, com o mesmo modelo, no mesmo dia. Uma variação dessa ordem torna insuficiente qualquer afirmação global sobre a reprodutibilidade de um estudo dessa natureza, e impõe que a medida seja feita e declarada campo a campo, do que decorre o conceito que hoje organiza a linha de pesquisa do doutorado, a replicabilidade funcional por campo.
Os números acima são os piores do trabalho, e estão publicados de propósito, porque o objeto da dissertação é o método de medição, e um método de medição só se demonstra em condições adversas.
Palavras-chave
Precedentes judiciais; Superior Tribunal de Justiça; tributos estaduais e municipais; pesquisa empírica em Direito; inteligência artificial; jurimetria.
No registro do repositório, os assuntos atribuídos são «Precedente judicial - Superior Tribunal de Justiça», «Decisão judicial - análise semântica» e «Direito tributário».
Como citar
MALKO, Fábio André. Extração automatizada e tratamento semântico de decisões judiciais com inteligência artificial: um método replicável aplicado a pesquisa de precedentes tributários do STJ. 2026. 198 f. Dissertação (Mestrado Profissional em Direito) — Instituto Brasileiro de Ensino, Desenvolvimento e Pesquisa, Brasília, 2026. Disponível em: https://repositorio.idp.edu.br/handle/123456789/5980. Acesso em: [data].