CoolFace
Datasetpublic

ffantini/jurisprudencia_stj_pt

Dataset de Jurisprudência do STJ de Portugal (2025) Descrição do Dataset Este dataset contém uma amostra de acórdãos proferidos pelo Supremo Tribunal de Justiça (STJ) de Portugal durante o ano de 2025. Cada registo no dataset corresponde a um acórdão completo, incluindo o seu texto integral, o sumário e um conjunto de metadados ricos. Os dados representam uma amostra aleatória de 5% do total de acórdãos de 2025 disponíveis na base de dados de origem, filtrados… See the full description on the dataset page: https://huggingface.co/datasets/ffantini/jurisprudencia_stj_pt.

sourceHugging Facecc-by-4.0updated 1y agoView on Hugging Face
0likes26downloads
Dataset Card

Dataset de Jurisprudência do STJ de Portugal (2025)

Descrição do Dataset

Este dataset contém uma amostra de acórdãos proferidos pelo Supremo Tribunal de Justiça (STJ) de Portugal durante o ano de 2025. Cada registo no dataset corresponde a um acórdão completo, incluindo o seu texto integral, o sumário e um conjunto de metadados ricos.

Os dados representam uma amostra aleatória de 5% do total de acórdãos de 2025 disponíveis na base de dados de origem, filtrados para incluir apenas registos com sumário preenchido.

Este recurso foi criado para apoiar a investigação e o desenvolvimento de aplicações de Processamento de Linguagem Natural (PLN) no domínio jurídico em língua portuguesa.

Tarefas Suportadas

O dataset é particularmente útil para uma variedade de tarefas de PLN, tais como:

  • —Sumarização de Texto: Utilizar o texto_integral como entrada e o sumario como o texto de referência (ground truth).
  • —Classificação de Texto: Classificar a decisão final de um acórdão utilizando a coluna decisao_tag como etiqueta.
  • —Question Answering / RAG (Retrieval-Augmented Generation): O texto_integral serve como uma base de conhecimento para responder a perguntas sobre o conteúdo dos acórdãos.
  • —Named Entity Recognition (NER): Identificar entidades jurídicas, nomes, datas e outros elementos específicos do domínio legal.

Idiomas

O texto no dataset está em Português (Portugal). O código de idioma correspondente é pt-PT.

Estrutura do Dataset

Campos de Dados

Cada registo no dataset representa um acórdão e possui os seguintes campos:

  • —doc_id (string): Identificador único do documento, geralmente o número do processo.
  • —texto_integral (string): O texto completo do acórdão.
  • —sumario (string): O sumário oficial do acórdão.
  • —tribunal (string): O tribunal de origem (neste dataset, sempre 'STJ').
  • —processo_numero (string): O número do processo.
  • —data_acordao (date): A data em que o acórdão foi proferido.
  • —relator (string): O nome do juiz relator.
  • —decisao_tag (string): Uma etiqueta curta que resume a decisão (ex: "NEGADA A REVISTA", "CONCEDIDA A REVISTA").
  • —tags (list[string]): Uma lista de tags ou palavras-chave associadas ao documento.
  • —url_original (string): O URL para o acórdão na fonte original.

Divisões (Splits)

O dataset contém uma única divisão de dados:

NomeNúmero de Registos
train[INSERIR Nº AQUI]

Podes encontrar o número exato de registos na página principal do dataset e atualizar a tabela.

Como Utilizar

Podes carregar o dataset facilmente utilizando a biblioteca datasets do Hugging Face:

python
from datasets import load_dataset

# Carregar o dataset
ds = load_dataset("ffantini/jurisprudencia_stj_pt")

# Aceder ao split de treino
train_split = ds['train']

# Imprimir o primeiro exemplo
print(train_split[0])