CoolFace
Datasetpublic

andrebadini/repojus

RepoJus: Jurisprudência Brasileira de Inteiro Teor O RepoJus é um corpus consolidado de decisões judiciais e administrativas brasileiras obtidas de fontes públicas oficiais. O snapshot v2 reúne 4.106.391 registros canônicos, sem duplicatas de normalized_hash, em 4.666 shards Parquet determinísticos (39.290.819.138 bytes). O corpus foi estruturado para pesquisa jurídica, recuperação de informação, RAG, classificação, sumarização, extração de entidades e treinamento ou avaliação… See the full description on the dataset page: https://huggingface.co/datasets/andrebadini/repojus.

sourceHugging Facecc-by-4.0updated 2d agoView on Hugging Face
4likes2.3kdownloads
Dataset Card

RepoJus: Jurisprudência Brasileira de Inteiro Teor

O RepoJus é um corpus consolidado de decisões judiciais e administrativas brasileiras obtidas de fontes públicas oficiais. O snapshot v2 reúne 4.106.391 registros canônicos, sem duplicatas de normalized_hash, em 4.666 shards Parquet determinísticos (39.290.819.138 bytes).

O corpus foi estruturado para pesquisa jurídica, recuperação de informação, RAG, classificação, sumarização, extração de entidades e treinamento ou avaliação de modelos de linguagem em português. Os registros preservam tanto um esquema canônico estável quanto o objeto original serializado, para permitir auditoria e reprocessamento.

Versão de dados: o conteúdo Parquet descrito nesta ficha está fixado no commit 5791ee745a5f63a9280bcf7e94e0242eaae88911. Commits posteriores exclusivamente documentais não mudam os shards desse snapshot.

Visão geral do snapshot v2

PropriedadeValor
Registros4.106.391
normalized_hash distintos4.106.391
Shards Parquet4.666
Tamanho dos shards39.290.819.138 bytes (~39,29 GB)
Tribunais/órgãos15
Grupos tribunal/source_key/tipo_decisao22
Versão do esquema2.0.0
Fingerprint do esquemaa74f5a7ad0efb846e1f03b3953f3f8a4d0525aae2dd19268d4c6ba6e09f4ed0a
Digest lógico global660504be6f95535ce3aca8e15ffa8a0c03091197489dc0e5240b56ebe7698a12
Snapshot predecessorb0b750e45bdf51f378bc57e25a5c15f92b51c900

Contagens por tribunal ou órgão

Tribunal/órgãoRegistrosShardsCobertura por ano
TJDFT1.338.3949622017–2026
TJMT969.6421.1512015–2026
STF531.7381.4211971–2026
TJSP335.7994652014–2026
TJES213.2431122020–2026
TJBA172.0621122020–2026
TCU171.4791122020–2026
CARF163.4661162009–2026
TJPA145.1911122020–2026
STJ31.69622025–2026
TRF313.539531953–2026
TRE-PR11.35972020–2026
STM4.21472020–2026
TJMMG3.19572020–2026
CVM1.374271999–2025
Total4.106.3914.6661953–2026

As datas mínima e máxima da tabela usam a partição anual. Registros com data ausente ou inválida podem estar associados a uma partição de fallback; consulte counts.csv para a distribuição exata por grupo e ano.

Contagens por fonte e tipo de decisão

Tribunal`source_key`TipoRegistros
CARFcarf_acordaosacórdão163.374
CARFcarf_sumulassúmula92
CVMcvm_acordaosacórdão1.374
STFstf_acordaosacórdão219.224
STFstf_monocraticasmonocrática312.514
STJstj_djen_acordaosacórdão31.696
STMstm_jurisprudencia_acordaosacórdão4.214
TCUtcu_acordaosacórdão171.479
TJBAtjba_jurisprudencia_acordaosacórdão172.062
TJDFTtjdft_acordaosacórdão735.642
TJDFTtjdft_acordaosmonocrática602.752
TJEStjes_jurisprudencia_acordaosacórdão213.243
TJMMGtjmmg_acordaosacórdão3.195
TJMTtjmt_acordaosacórdão459.391
TJMTtjmt_jurisprudencia_acordaosacórdão427.870
TJMTtjmt_monocraticasmonocrática82.381
TJPAtjpa_jurisprudencia_acordaosacórdão145.191
TJSPtjsp_acordaosacórdão334.108
TJSPtjsp_monocraticasmonocrática1.691
TRE-PRtre-pr_portal_acordaosacórdão11.359
TRF3trf3_acordaosacórdão13.235
TRF3trf3_hybrid_acordaosacórdão304

Organização dos arquivos

Os registros estão em Parquet com particionamento Hive:

text
data/v2/
  p_tribunal=<TRIBUNAL>/
    p_source_key=<SOURCE_KEY>/
      p_tipo_decisao=<TIPO>/
        p_year=<ANO>/
          p_bucket=<BUCKET_HEX>/
            part-00000.parquet

Os buckets derivam da chave canônica e tornam a distribuição e a reescrita determinísticas. Os caminhos legados data/<tribunal>/full/.../*.jsonl.gz pertencem ao snapshot anterior e não são caminhos válidos para o v2.

Arquivos de controle do snapshot:

  • snapshot-manifest.json: caminho, SHA-256, bytes, linhas, limites de hash e digest lógico de cada shard;
  • schema.json: esquema Arrow explícito, versão e fingerprint;
  • counts.csv: contagens por tribunal, fonte, tipo, ano e quantidade de shards;
  • evidence/source-policy.csv e .json: decisão de inclusão/exclusão dos novos grupos coletados;
  • evidence/legacy-manifest-audit.json: auditoria dos manifests do snapshot predecessor;
  • history/b0b750e45bdf51f378bc57e25a5c15f92b51c900/: metadados históricos preservados do snapshot JSONL, sem restaurar seus shards.

Configurações disponíveis

A configuração default lê todo o snapshot v2. Há também configurações por tribunal (tribunal-tjsp, tribunal-stf, etc.) e por combinação exata de fonte/tipo (tjsp-acordaos-acordao, tjdft-acordaos-monocratica, etc.). Todas apontam exclusivamente para data/v2/**/*.parquet.

Para cargas menores, prefira a configuração mais específica. Isso reduz tráfego, tempo de enumeração e custo de processamento.

Esquema canônico 2.0.0

CampoTipoUso
schema_versionstringVersão do esquema canônico (2.0.0)
normalized_hashstringSHA-256 normalizado e chave canônica global
tribunalstringSigla do tribunal ou órgão
source_keystringIdentificador estável da fonte de coleta
tipo_decisaostringacordao, monocratica ou sumula
processostringNúmero processual, quando disponível
datajulgamentostringData do julgamento normalizada como texto
datapublicacaostringData da publicação normalizada como texto
relatorstringNome do relator, quando disponível
orgaojulgadorstructEstrutura com o nome do órgão/relator de origem
orgaojulgadorcolegiadostructEstrutura com o órgão colegiado
classestructClasse processual
assuntoslist[struct]Assuntos associados ao julgado
ementastringEmenta ou resumo oficial
texto_integralstringInteiro teor normalizado
urlstringURL pública de origem, quando disponível
quality_statusstringEstado da avaliação de qualidade
quality_flagslist[string]Sinais de qualidade observados
created_atstringMomento de criação/captura normalizado
partition_yearstringAno usado no particionamento
snapshot_originstringOrigem do registro no snapshot consolidado
baseline_commit_shastringLinhagem do registro legado
metadata_extra_jsonstringMetadados extras em JSON canônico
original_record_jsonstringRegistro original integral em JSON canônico
record_variants_jsonlist[string]Variantes preservadas em conflitos de origem

Todos os campos do esquema canônico são não nulos. Ausência semântica é representada pelo valor vazio apropriado, mantendo um esquema estável entre shards. original_record_json preserva campos e estruturas do registro anterior que não foram promovidos a colunas canônicas.

Como usar

Streaming com datasets

Fixe o commit de dados quando a reprodutibilidade for importante:

python
from datasets import load_dataset

data_sha = "5791ee745a5f63a9280bcf7e94e0242eaae88911"
dataset = load_dataset(
    "andrebadini/repojus",
    "tribunal-tjsp",
    split="train",
    streaming=True,
    revision=data_sha,
)

for record in dataset.take(1):
    print(record["processo"])
    print(record["normalized_hash"])
    print(record["texto_integral"][:300])

Carregar uma fonte específica

python
from datasets import load_dataset

dataset = load_dataset(
    "andrebadini/repojus",
    "tjpa-jurisprudencia-acordaos-acordao",
    split="train",
    streaming=True,
    revision="5791ee745a5f63a9280bcf7e94e0242eaae88911",
)

Consultar diretamente os Parquet com DuckDB

sql
SELECT tribunal, partition_year, count(*) AS julgados
FROM read_parquet(
  'hf://datasets/andrebadini/repojus@5791ee745a5f63a9280bcf7e94e0242eaae88911/data/v2/**/*.parquet',
  hive_partitioning = true
)
GROUP BY tribunal, partition_year
ORDER BY tribunal, partition_year;

Para uma cópia integral, reserve espaço adicional além dos ~39,29 GB compactados. Streaming ou seleção por configuração é recomendado quando o objetivo não exige todos os tribunais.

Consolidação, deduplicação e qualidade

O snapshot v2 é uma consolidação lógica completa. Ele contém todas as 3.129.257 chaves canônicas distintas do predecessor e 977.134 novos acórdãos, totalizando 4.106.391 chaves únicas.

A consolidação:

  1. 1.normaliza e valida normalized_hash;
  2. 2.agrupa variantes da mesma chave canônica;
  3. 3.preserva o objeto original e conflitos relevantes;
  4. 4.aplica esquema Arrow explícito;
  5. 5.ordena e distribui por partições determinísticas;
  6. 6.registra hashes e digests para reabertura independente.

No manifesto do snapshot, os seguintes contadores de conservação são zero:

  • chaves legadas ausentes;
  • objetos de origem legados ausentes;
  • chaves novas incluídas ausentes;
  • objetos de origem novos incluídos ausentes;
  • chaves novas excluídas presentes;
  • objetos de origem novos excluídos presentes.

Essas verificações são mais fortes que uma comparação apenas por total de linhas.

Sanitização e proveniência

Os coletores padronizam HTML residual, espaços, quebras de linha e outros ruídos de captura. Dependendo da fonte, podem existir rotinas para assinaturas eletrônicas repetitivas, cabeçalhos, rodapés e hifenização de OCR. O texto canônico serve ao consumo analítico; o registro original permanece disponível em original_record_json para auditoria.

source_key, snapshot_origin, baseline_commit_sha, metadata_extra_json e os manifests de evidência documentam a linhagem. Consulte sempre a URL oficial antes de usar um registro em contexto jurídico sensível.

Privacidade, ética e limitações

As decisões foram obtidas em fontes públicas oficiais. Ainda assim, textos jurídicos podem conter dados pessoais, nomes de partes, testemunhas, advogados ou outros elementos sensíveis tal como publicados na origem. O dataset não deve ser usado para assédio, discriminação, perfilamento indevido ou decisões automatizadas de alto impacto sem revisão humana e base legal apropriada.

Algumas limitações importantes:

  • cobertura não implica completude absoluta do acervo de cada órgão;
  • datas e campos estruturados dependem da qualidade da fonte;
  • decisões podem ser posteriormente retificadas, anonimizadas ou retiradas pela origem;
  • o texto normalizado não substitui a publicação oficial;
  • filtros de qualidade reduzem lotes implausíveis, mas não eliminam todo erro de coleta ou parsing.

Usuários são responsáveis por avaliar LGPD, segredo de justiça, finalidade, segurança e demais obrigações aplicáveis ao seu caso de uso.

Licença

Textos oficiais devem ser avaliados conforme o regime jurídico aplicável, incluindo o art. 8º da Lei brasileira 9.610/1998. A seleção, organização, normalização, metadados agregados e documentação do RepoJus são disponibilizados sob Creative Commons Attribution 4.0 International (CC-BY-4.0). A atribuição deve indicar este dataset e o commit utilizado.

Histórico documental

O snapshot predecessor em JSONL foi publicado no commit b0b750e45bdf51f378bc57e25a5c15f92b51c900. Seus shards JSONL não foram restaurados no v2. O resumo de exportação e os 15 manifests efetivamente presentes naquele commit foram preservados, byte a byte, em history/b0b750e45bdf51f378bc57e25a5c15f92b51c900/, com índice de proveniência e SHA256SUMS.

Essa contagem histórica é deliberadamente derivada da árvore imutável do commit: apesar de referências externas a “16 manifests”, o commit predecessor contém 15 arquivos chamados manifest.json mais data/export_summary.json.

Contato

Ao relatar um problema de dados, informe o normalized_hash, a configuração, o caminho do shard e o commit consultado. Isso permite uma investigação reprodutível sem depender apenas de exemplos visuais do Dataset Viewer.

andrebadini/repojus · CoolFace