LABDAPS/texto-clinico-brasileiro
Texto Clinico Brasileiro Dataset unificado de texto clinico em portugues brasileiro para NLP. Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico. Conteudo Dataset Registros Tipo Acesso Fonte MedPT 384.085 Perguntas e respostas medicas Livre AKCIT/MedPT Sepse HC-RP 200 Resumos de alta hospitalar Livre Dataverse Total: 384.285 registros | Tamanho:… See the full description on the dataset page: https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro.
Texto Clinico Brasileiro
Dataset unificado de texto clinico em portugues brasileiro para NLP.
Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico.
Conteudo
Total: 384.285 registros | Tamanho: ~95 MB (Parquet)
Schema
id : str -- identificador unico (ex: "medpt_000001", "sepse_hcrp_0001")
text : str -- texto clinico
source : str -- dataset de origem (medpt, sepse_hcrp)
text_type : str -- tipo de texto (qa_pair, discharge_summary)
specialty : str -- especialidade medica
metadata : str -- JSON com campos especificos do dataset originalEspecialidades (top 10)
Como usar
from datasets import load_dataset
ds = load_dataset("LABDAPS/texto-clinico-brasileiro")
# Filtrar por fonte
medpt = ds["train"].filter(lambda x: x["source"] == "medpt")
sepse = ds["train"].filter(lambda x: x["source"] == "sepse_hcrp")
# Filtrar por especialidade
cardio = ds["train"].filter(lambda x: "Cardiologista" in x["specialty"])Pipeline de geracao
O dataset e gerado pelo pipeline do repositorio pt-br-clinical-nlp, que baixa, normaliza e unifica os datasets originais em um schema padrao.
Extensibilidade
O pipeline suporta datasets adicionais com acesso credenciado:
Para incluir esses datasets, siga as instrucoes em pt-br-clinical-nlp.
Citacao
@dataset{texto_clinico_brasileiro_2026,
title={Texto Clinico Brasileiro: Dataset Unificado de Texto Clinico em Portugues para NLP},
author={Fabiano Filho},
year={2026},
url={https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro},
note={Agrega MedPT e Sepse HC-RP em schema padronizado}
}Licenca
Codigo do pipeline: MIT. Dados pertencem aos autores originais com suas respectivas licencas.
Autor
LABDAPS -- Laboratorio de Big Data e Analise Preditiva em Saude, FSP-USP
Fabiano Filho -- Medico, Cientista de Dados, Doutorando FSP-USP (LABDAPS)
