ffantini/jurisprudencia_stj_pt
Dataset de Jurisprudência do STJ de Portugal (2025) Descrição do Dataset Este dataset contém uma amostra de acórdãos proferidos pelo Supremo Tribunal de Justiça (STJ) de Portugal durante o ano de 2025. Cada registo no dataset corresponde a um acórdão completo, incluindo o seu texto integral, o sumário e um conjunto de metadados ricos. Os dados representam uma amostra aleatória de 5% do total de acórdãos de 2025 disponíveis na base de dados de origem, filtrados… See the full description on the dataset page: https://huggingface.co/datasets/ffantini/jurisprudencia_stj_pt.
Dataset de Jurisprudência do STJ de Portugal (2025)
Descrição do Dataset
Este dataset contém uma amostra de acórdãos proferidos pelo Supremo Tribunal de Justiça (STJ) de Portugal durante o ano de 2025. Cada registo no dataset corresponde a um acórdão completo, incluindo o seu texto integral, o sumário e um conjunto de metadados ricos.
Os dados representam uma amostra aleatória de 5% do total de acórdãos de 2025 disponíveis na base de dados de origem, filtrados para incluir apenas registos com sumário preenchido.
Este recurso foi criado para apoiar a investigação e o desenvolvimento de aplicações de Processamento de Linguagem Natural (PLN) no domínio jurídico em língua portuguesa.
Tarefas Suportadas
O dataset é particularmente útil para uma variedade de tarefas de PLN, tais como:
- Sumarização de Texto: Utilizar o
texto_integralcomo entrada e osumariocomo o texto de referência (ground truth). - Classificação de Texto: Classificar a decisão final de um acórdão utilizando a coluna
decisao_tagcomo etiqueta. - Question Answering / RAG (Retrieval-Augmented Generation): O
texto_integralserve como uma base de conhecimento para responder a perguntas sobre o conteúdo dos acórdãos. - Named Entity Recognition (NER): Identificar entidades jurídicas, nomes, datas e outros elementos específicos do domínio legal.
Idiomas
O texto no dataset está em Português (Portugal). O código de idioma correspondente é pt-PT.
Estrutura do Dataset
Campos de Dados
Cada registo no dataset representa um acórdão e possui os seguintes campos:
doc_id(string): Identificador único do documento, geralmente o número do processo.texto_integral(string): O texto completo do acórdão.sumario(string): O sumário oficial do acórdão.tribunal(string): O tribunal de origem (neste dataset, sempre 'STJ').processo_numero(string): O número do processo.data_acordao(date): A data em que o acórdão foi proferido.relator(string): O nome do juiz relator.decisao_tag(string): Uma etiqueta curta que resume a decisão (ex: "NEGADA A REVISTA", "CONCEDIDA A REVISTA").tags(list[string]): Uma lista de tags ou palavras-chave associadas ao documento.url_original(string): O URL para o acórdão na fonte original.
Divisões (Splits)
O dataset contém uma única divisão de dados:
Podes encontrar o número exato de registos na página principal do dataset e atualizar a tabela.
Como Utilizar
Podes carregar o dataset facilmente utilizando a biblioteca datasets do Hugging Face:
from datasets import load_dataset
# Carregar o dataset
ds = load_dataset("ffantini/jurisprudencia_stj_pt")
# Aceder ao split de treino
train_split = ds['train']
# Imprimir o primeiro exemplo
print(train_split[0])