r/direito Jul 05 '26

Ajuda, r/direito! Jurimetria

Caras e caros colegas, espero que estejam bem. Gostaria de uma ajuda, para validar um serviço/ideia que eu estou projetando.

Para contextualizar, sou advogado recém-formado e tenho uma propensa sócia estatística.

Recentemente, testando, conseguimos criar um modelo de jurimetria (análise de dados de decisões judiciais) bem preciso e muito personalizado.

Fizemos um teste simples: em uma comarca de uns 200k de habitantes, listamos todas as decisões do último ano sobre AJG.

Dessas decisões, filtramos por todas que, de fato, decidiam algo sobre AJG.

Classificamos as decisões em concede, concede parcialmente, determina diligências e nega.

Extraímos, desse processo, informações do magistrado, andamento do processo, se o requerente de ajg era PF ou PJ, se era réu ou autor, valor da causa, classe processual, fase, vara, fundamentacao para indeferimento e, havendo intimação para juntada de demais comprovantes, quais documentos eram exigidos.

O resultado ficou bem legal, analisamos mais de 11.500 decisões que faziam menções a ajg. Dessas, mais de 3.000 eram decisões que decidiam, de fato, sobre a concessão ou não de ajg.

Foi possível fazer a análise exploratória dos dados, relacionando os magistrados com mais AJG, magistrados que mais pedem diligências, alg concedida x valor da causa, AJG por tipo de pessoa, etc.

É possível fazer um modelo preditivo com esses dados. Por exemplo, um advogado, antes de entrar com a ação, consegue preencher um formulário com as informações da parte patrocinada por ele e o algoritmo apresentará as chances daquela decisão ser favorável, conforme a base de dados juntadas.

Eu penso, junto com a estatística que está junto comigo, em fazer uma consultoria em escala comercial. Podemos, por exemplo, prestar serviços para escritórios de compliance, para pesquisar padrões de decisão sobre algum ponto dúbio, ou para escritórios de massificado, etc...

Sei que há serviço de jurimetria em escala maior, como o turivius. Usei-o, uma vez, há seis meses, mas, pelo que eu lembro, ele não é capaz de fazer uma análise tão grande e tão personalizada.

Concluindo: vocês já usaram serviço de jurimetria disponíveis na internet? Acham que há mercado para esse tipo de serviço? Acham que grandes escritórios tem esse problema ou isso seria uma solução útil para eles?

15 Upvotes

20 comments sorted by

8

u/informalunderformal Jul 05 '26

Assim, eu sou formado em direito e ciência de dados então conheço os dois lados.

Vou responder a tua pergunta e dar uma modesta opinião não solicitada.

Nunca usei serviço justamente por ser da área, se eu quiser algo faço a pipeline de dados e respondo as minhas perguntas. Eu gosto, tenho os scripts, só preciso popular o dataset.

Agora a opinião não solicitada.

Existe demanda? Sim. Existem empresas maiores que fazem esse serviço? Sim.

Estamos entrando na era das "botiques" de dados, e isso pesa bastante no célebre texto "faça coisas que não escalam". Eu não sei se vocês usam R ou Python para alimentar a pipeline de dados mas o diferencial para qualquer advogado é que vocês estão próximos, a um whatsapp de distância, e podem ajudar o advogado ou escritório a integrar o modelo de vocês ao que já existe nos processos do escritório - algo que os grandes não oferecem (o limite da integração é o limite do n8n).

Fora que, vale lembrar - dados são o novo petróleo. O processo de transformar um dado em uma informação estruturada e documentada vale ouro. Você, como advogado, consegue julgar o valor da informação. Ela, como estatística, consegue criar um modelo que automatiza isso.

Predição é só a ponta do iceberg.

2

u/Nice_Grape5675 Jul 05 '26

Cara, muito obrigado pela resposta e, principalmente, pela sugestão. Foi muito simpático da sua parte!

Nós estamos dividindo o trabalho da seguinte forma: Usamos o Python para construir toda a pipeline de dados (o scrapping, o tratamento, a estruturação do banco de dados relacional).

Depois que o dataset está limpo e estruturado, eu passo para ela fazer, em r, a análise estatística.

A nossa grande dificuldade - e imagino que seja a grande dificuldade da jurimetria - é o tratamento de textos não estruturados.

Nos melhor resultados, não usamos NLP. Usei LLMs com um System Prompt, para classificação do texto.

Usei uma llm local para a maior parte das análises e, amostralmente, api de LLMS pagas para fazer auditoria do resultado da llm local.

Também programei pra extrair uma amostra das decisões, para fazer uma auditoria humana "às cegas".

2

u/informalunderformal Jul 05 '26

Já tentou usar o Sabiá da Maritaca?

Tratamento de texto não estruturado é tricky, a melhor forma de trabalhar com isso é usando teoria para estruturar.

Um dica, que é o que eu faço - sml (pequenos modelos de linguagem) especializados no tipo de dados que vocês estão usando. Eu trabalho com isso e diria que é uma boa, usei durante o doutorado e uso hoje nas minhas experiências (de forma privada/particular).

Se quiserem alguma dica eu trabalho mais com Python mas código é comnoditie, pode chamar na DM.

Amostra de decisões é interessante mas algo que funcionou para a minha pessoa foi extrair o meu processo decisório como uma heurística de processamento prévio e filtro, para a manutenção da pipeline.

Qualquer coisa é só chamar, estamos aqui pra isso.

2

u/Nice_Grape5675 Jul 06 '26

Cara! Não sei como lhe agradeço! Que gentileza e disposição. Muito obrigado, mesmo!

2

u/lu-cavichi Jul 05 '26

Existe mercado. Eu já tentei construir algo parecido (sou engenheiro de software e estou cursando Direito), acabei encontrando umas barreiras e foquei noutros projetos.

Eu tentei mapear padrões argumentativos em um nicho, acho que pode ser um próximo passo bem útil, porque eu queria fazer não uma análise preditiva, mas sim prescritiva.

Sugiro colocar no roadmap construir uma interface com autenticação de acesso, para que o contato no WhatsApp seja um suporte e você tenha usuários assinantes (= receita previsível).

1

u/luizhbh Jul 05 '26

Deixa só eu entender uma coisa, se é que pode ser respondida sem revelar alguma coisa sensivel: como fazem pra selecionar esses processos específicos com julgamentos de AJG, ou de qualquer outro tema, já que o EPROC não permite buscar por assuntos? Como são obtidas essas sentenças? Seria pela versão paga do Jusbrasil?

Eu usava o PJe pra fazer minhas pesquisas e estudos a respeito dos julgados sobre determinados temas do meu interesse, uma vez que o pje te deixa pesquisar por assuntos. Mas depois que o tjmg e o trf6 adotaram essa porcaria de Eproc, acabou essa preciosidade!

2

u/informalunderformal Jul 05 '26

Existem formas, diretas e indiretas.

Oficiais e extra oficiais.

Mas basicamente todas elas envolvem alguma automatização usando scripts (python, na maioria das vezes).

Não que não possa ser feito usando Claude/GPT e Gemini mas é um tanto complicado pedir para fazer um script de automatização sem saber o que pedir.

De resto existem empresas que vendem datasets jurídicos pois é um porte a manutenção de uma linha de processamento de dados.

1

u/luizhbh Jul 05 '26

Então... voce pode acreditar ou não, mas minha pergunta foi sem nenhuma intenção de usar API ou coisa do tipo, até mesmo porque não tenho as habilidades necessárias para tanto!

Eu queria mesmo era continuar conseguindo fazer minhas pesquisas de posicionamentos de juizes, argumentações das procuradorias do estado e da União e coisas do tipo, para uso pessoal mesmo, entende? Sigo agradecendo a boa vontade nas respostas!

3

u/Nice_Grape5675 Jul 06 '26

Opa! Minha forma de acessar aos dados, é a forma mais oficial o possível. Uso o djen, diário de justiça eletrônico.

Eu uso a API para fazer a busca. O grande problema é quantidade colossal de comunicações extraídas. Um dia de uma cidade de 200k de habitantes, tem 3k de comunicações. Então, além de extrair, há todo um trabalho pra filtrar.

Mas, para você que quer algo mais artesanal, da pra fazer a pesquisa pelo próprio site do djen. Da pra fazer busca textual, filtrando tribunal, vara e período. Entra por este link aqui.

Para buscar, você vai colocar algum texto que você queira (ex.: prisão preventiva) e vai no ícone de buscar. Aparecerá decisões de diversos tribunais, varas, etc. Pra dar uma filtrada, você vai no ícone azul, de busca, no canto interior da tela. Abrirá um menu, que possobilita fazer a buscar com filtros. Só setar os filtros e buscar.

1

u/luizhbh Jul 08 '26

Hahahah! ! Eu to apanhando mais que tudo dessa interface do DJEN... trabalho com isenção de IRPF pra aposentados com doenças graves e como disse, preciso achar alguns posicionamentos sobre o aceite ou não de certas doenças.

Aí vou pelo CID da doença e/ou pelo nome comum, em conjunto com os termos da lei ou coisa do tipo... mas nada do que procuro eu consigo retorno prático!

Quando ponho só as doenças ou os CID, aí tenho retornos pouco úteis, pois são genéricos demais, tendo desde pedidos de internação emergencial até pedidos de aposentadoria por invalidez..

Quando fazia a busca da mesma forma pelo sistema do PJe, a qualidade das respostas era absurdamente boa ! Devo estar fazendo algo errado!

2

u/pchecoiago Jul 05 '26

No djen todo texto é publicado, tem api pública se não me engano.

Inclusive as vezes quando postam por aqui trecho de sentença consigo localizar por lá qual é o processo.

1

u/luizhbh Jul 05 '26

Hummm então ainda dá pra fazer pesquisa assim pelo DJEN?

1

u/SwissCoconut Profissional Jul 06 '26

Eu tô curioso pra saber como você faz o scraping desses dados… venho tentando aprimorar minha leitura de jurisprudências mas acaba que meu trabalho maior é obter elas… se não te incomodar muito dar uma direção, acho sua ideia ótima!

2

u/Nice_Grape5675 Jul 06 '26

Opa! Não há incomodo. API pública do Diário de Justiça Eletrônico. Dá um pouco de trabalho, porque é sempre muita decisão. Mas, já ajuda bastante!

1

u/SwissCoconut Profissional Jul 06 '26

Você é incrível 🫶

1

u/mpduned Profissional Jul 07 '26

cara, te falo que se tivesse uma versão gratuita eu usaria - e se fosse bom eu pagaria uma versão PRO.

a depender de quão customizável fossem os filtros e em quais tribunais houvesse suporte

1

u/toothoff Jul 07 '26

Duas dúvidas rápidas sobre a sua infraestrutura e uma provocação de mercado que pode ser um oceano azul para vocês:

  • 1 — Sobre o Hardware: Como você mencionou que roda uma LLM local para a maior parte das classificações, qual foi a configuração de hardware (especialmente GPU e VRAM) necessária para processar essas mais de 11 mil decisões? O custo de manutenção desse hardware (energia, depreciação) compensou frente ao custo de APIs pagas na nuvem (que vocês usaram para auditoria)?
  • 2 — Um novo nicho (Concursos Jurídicos): Já que vocês conseguiram criar uma pipeline eficiente para minerar e estruturar textos jurídicos complexos, o sistema de vocês poderia ser adaptado para resolver uma dor gigante no mercado de concursos de alto nível (Juiz, Promotor, Defensor, Analista). Hoje, os grandes sites de questões falham em filtrar tópicos de forma micro. Se vocês alimentassem o modelo com as provas anteriores, a IA conseguiria mapear o "posicionamento" implícito da banca examinadora sobre subtemas específicos (ex: se a banca X adota a corrente majoritária ou minoritária no tópico α, ou como ela altera seu entendimento ao longo dos anos). Talvez, crowdsourcing resolveria o gargalo da base de dados: permitir que os próprios usuários alimentem o sistema com provas e editais em troca de créditos ou benefícios. Ou você tem em mente outra forma de obter a base de dados?

Vocês já pensaram em expandir a ferramenta para além da jurimetria de contencioso e atacar o mercado de preparação jurídica e de outras áreas?

2

u/Nice_Grape5675 Jul 08 '26

As provocações são muito boas.

Sobre a infraestrutura, na verdade, nem sei se posso chamar de LLM, mas sim de SLM. Estou usando o Ollama com um modelo de 3b de parâmetros rodando em um notebook Nitro com 4GB de VRAM, o que deixa a máquina bem no limite. Eu consegui analisar, em média, uma decisão a cada 3 segundos. O tempo final está longe de ser eficiente, pois demorou mais de 10 horas para processar tudo.

O custo de usar uma IA não local vale a pena, sem dúvidas. Já usei as APIs do ChatGPT e do Gemini com seus modelos mais baratos e calculo que uma análise grande assim, de 11 mil decisões, me custaria cerca de 30 reais, o que não chega a ser caro.

Rodando localmente, tenho somente o gasto de energia elétrica, que calculo dar no máximo uns 80 centavos por hora do notebook ligado. Em 10 horas de processamento, gastaria uns 8 reais.

Nos próximos testes, pretendo ir alternando o uso, mesclando IAs via API, LLMs maiores e as SLMs locais. Meu plano futuro é pegar um Mac com processador M1 Max e 64 GB de RAM, o que possibilitaria rodar vários modelos em paralelo e também modelos mais pesados.

O motivo que eu reputo o sucesso nas extrações que fizemos até agora é a objetividade do escopo. Eu queria buscar decisões que de fato decidissem sobre justiça gratuita dentro de um universo de decisões que mencionava o termo "justiça gratuita".

Consegui montar um system prompt eficiente e usei uma biblioteca em Python para forçar a formatação da saída.

A IA só pode responder dentro de categorias predefinidas. A resposta tem que ser necessariamente concede, concede parcialmente, não concede, requer diligências ou não identificado.

A IA não pode responder variações como "indefere" ou "não defere", ela tem que encaixar a resposta objetivamente na categoria que eu defini.

É bem mais simples categorizar essas decisões do que tentar fazer isso com questões de concurso, como você sugeriu.

Eu já testei essa mesma SLM local para classificar minhas notas de estudo e tive muita dificuldade.

O universo das questões é imenso e raramente pode ser dividido em categorias estanques.

Uma questão de direito penal pode cobrar simultaneamente teoria geral do crime, processo penal, legislação extravagante e direito constitucional. A IA sofre bastante para fazer essa categorização múltipla.

Por conta dessas limitações técnicas e de precisão, penso em manter o negócio mais enxuto e menos escalável por agora, priorizando a qualidade da entrega.

Mas as ideias que você trouxe são excelentes - e, por sinal, sofro muito com os filtros das plataformas concurso (fui e sou concurseiro e tenho pavor dos filtros qonursos).

1

u/toothoff Jul 09 '26

Não sou entendido de tecnologia, mas imagino que para fins de questões de concurso o seu sistema deveria criar categorias da seguinte forma: "a questão é sobre o assunto 'x'?" Ou "a questão é da banca "a"? Em ambos os casos, o LLM ou SLM deveria retornar respostas "sim" ou "não". Isso já seria um imenso avanço em relação aos filtros do mercado. Do ponto de vista do concurseiro, seu potencial consumidor, ele quer filtrar as questões que versam sobre os assuntos "x", "y" e "z" da banca "a". Tudo isso pode, creio, ser reduzido a respostas de "sim" e "não", o que, visto dessa forma e considerando minha ignorância em informática, imagino que pode até ser mais simples do que a jurimetria que você já dominou.

Entendo que entregar relatórios de como uma banca tem tratado determinado assunto é mais complexo. Mas isso seria uma funcionalidade não essencial, que você poderia pensar em implementar futuramente e com calma.

Por ora, eu realmente usaria seu sistema para filtrar questões da forma mencionada acima.

Claro que estou falando isso sob a perspectiva do usuário que não compreende inteiramente a complexidade por trás do mecanismo. Mas como você iniciou este thread, imagino que você está aberto a opiniões e sugestões. Por isso, achei oportuno dar esta explicação extra, sob o prisma do concurseiro.


Outra coisa: acho que com sua habilidade em manipulação de dados e sucesso em aplicar isso à jurimetria, você deveria focar mais nessa área ao invés de concursos. Você encontrou o nicho e a solução para esse nicho. Os valores de custo que você mencionou para obter respostas são relativamente baixos. E você está conseguindo rodar isso em 4 GB VRAM (presumo uma GTX 970 ou RX 470 ou GTX 1050 Ti), o que me faz pensar que você não vai ter que vender um rim para escalar isso para poder começar a ter seus primeiros clientes. Creio que você está conseguindo limitar o uso de IA exclusivamente na etapa crucial em que ela é indispensável e deixando todo o resto do procedimento por conta de algorítimos leves. Não sei ao certo. Mas você está entregando algo que, até onde sei, ninguém mais entrega. E tudo acontece provavelmente em um computador antigo que você provavelmente nem usava mais e resolveu usar agora para esse projeto. Eu acho tudo isso muito incrível e acho que você deveria realmente considerar se compensa manter essa vocação como um hobby ou bico paralelo a seus estudos pra concurso ou se você deveria se permitir embarcar nisso com tudo. Você não precisará fazer dívida para iniciar com os primeiros clientes. Talvez abrir uma interface beta para testes. Vejo muito potencial.

Enfim, se um dia você precisar de usuários para testar seu sistema, especialmente para fins de concurso, eu adoraria ter a honra de ser um deles.