walmeidadf/STJ-SumBR
STJ-SumBR Dataset de sumarização jurídica construído a partir de acórdãos públicos do Superior Tribunal de Justiça do Brasil (STJ). Cada exemplo alinha o inteiro teor de um acórdão com a ementa oficial produzida pela Secretaria de Jurisprudência do STJ. Resumo O STJ disponibiliza publicamente dois conjuntos de dados via STJ Dados Abertos: os espelhos de acórdãos (metadados estruturados e ementa) e as íntegras (texto completo em PDF convertido para TXT). Este… See the full description on the dataset page: https://huggingface.co/datasets/walmeidadf/STJ-SumBR.
STJ-SumBR
Dataset de sumarização jurídica construído a partir de acórdãos públicos do Superior Tribunal de Justiça do Brasil (STJ). Cada exemplo alinha o inteiro teor de um acórdão com a ementa oficial produzida pela Secretaria de Jurisprudência do STJ.
Resumo
O STJ disponibiliza publicamente dois conjuntos de dados via STJ Dados Abertos: os espelhos de acórdãos (metadados estruturados e ementa) e as íntegras (texto completo em PDF convertido para TXT). Este projeto cruza essas duas fontes por numeroRegistro para produzir pares supervisionados adequados a tarefas de sumarização automática de decisões judiciais em português brasileiro.
A cobertura inclui as 10 colegiados do STJ (seis turmas, três seções e a Corte Especial), com acórdãos de 2022 a 2026.
Tarefas suportadas
- Sumarização extrativa/abstrativa (
documento→ementa) - Sumarização estruturada (
documento→resumo_contexto,resumo_instituto,resumo_fundamentacao,resumo_entendimento) — disponível em ~16% dos exemplos, produzidos por ministros que adotam a estrutura I-IV a partir de 2025
Idioma
Português brasileiro (pt-BR). Linguagem jurídica formal.
Estrutura do dataset
Configurações
Splits
Estratificados por ano de julgamento (80 / 10 / 10).
Campos
Exemplo
{
"id": "REsp 2027136",
"turma": "TERCEIRA TURMA",
"area_direito": "civil",
"data_julgamento": "2024-08-27",
"relator": "NANCY ANDRIGHI",
"ementa": "DIREITO CIVIL. RECURSO ESPECIAL. RESPONSABILIDADE CIVIL...",
"documento": "ACÓRDÃO\nVistos, relatados e discutidos estes autos...",
"is_estruturada": False,
"n_tokens_documento": 4391
}Estatísticas
Dados originais
Os dados são disponibilizados publicamente pelo STJ em dadosabertos.web.stj.jus.br sob a Portaria CNJ 209/2019, que permite uso livre com atribuição.
- Espelhos de acórdãos: JSONs mensais por turma/seção, via API CKAN
- Íntegras: ZIPs diários de TXTs, via API CKAN
O código de coleta e processamento está disponível em github.com/walmeidadf/dataset-STJ-SumBR.
Considerações de uso
- Os acórdãos são documentos públicos que podem conter nomes de partes, advogados e outros dados pessoais. Nenhuma anonimização foi aplicada, seguindo o mesmo princípio de datasets jurídicos publicados na literatura (ex: RulingBR).
- O campo
documentopode ser longo (mediana ~4k tokens). Verifique os limites de contexto do modelo antes de usar. - A taxa de match espelho↔íntegra varia por turma e período (~93% na Terceira Turma, maio 2026). Exemplos sem íntegra têm
documento = nullehas_integra = false. - A estrutura I-IV está presente em acórdãos de 2025+ de ministros específicos. Não é representativa de toda a coleção.
Licença
- Dados originais (STJ): uso livre com atribuição — CNJ Portaria 209/2019
- Dataset compilado: CC BY 4.0
- Código: MIT
Citação
@dataset{stj-sumbr-2026,
title = {STJ-SumBR: Dataset de sumarização jurídica a partir de acórdãos do STJ},
author = {Almeida, Wesley},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/walmeidadf/STJ-SumBR},
note = {Dados originais: STJ Dados Abertos (dadosabertos.web.stj.jus.br),
licença CNJ Portaria 209/2019}
}