CoolFace
Datasetpublic

LABDAPS/texto-clinico-brasileiro

Texto Clinico Brasileiro Dataset unificado de texto clinico em portugues brasileiro para NLP. Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico. Conteudo Dataset Registros Tipo Acesso Fonte MedPT 384.085 Perguntas e respostas medicas Livre AKCIT/MedPT Sepse HC-RP 200 Resumos de alta hospitalar Livre Dataverse Total: 384.285 registros | Tamanho:… See the full description on the dataset page: https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro.

sourceHugging Facemitupdated 6mo agoView on Hugging Face
2likes33downloads
Dataset Card

Texto Clinico Brasileiro

Dataset unificado de texto clinico em portugues brasileiro para NLP.

Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico.

Conteudo

DatasetRegistrosTipoAcessoFonte
MedPT384.085Perguntas e respostas medicasLivreAKCIT/MedPT
Sepse HC-RP200Resumos de alta hospitalarLivreDataverse

Total: 384.285 registros | Tamanho: ~95 MB (Parquet)

Schema

id         : str   -- identificador unico (ex: "medpt_000001", "sepse_hcrp_0001")
text       : str   -- texto clinico
source     : str   -- dataset de origem (medpt, sepse_hcrp)
text_type  : str   -- tipo de texto (qa_pair, discharge_summary)
specialty  : str   -- especialidade medica
metadata   : str   -- JSON com campos especificos do dataset original

Especialidades (top 10)

EspecialidadeRegistros
Psicologo57.112
Ginecologista26.618
Urologista16.173
Dermatologista15.051
Ortopedista14.818
Oftalmologista12.109
Psiquiatra11.149
Dentista11.143
Psicanalista9.742
Otorrino7.734

Como usar

python
from datasets import load_dataset

ds = load_dataset("LABDAPS/texto-clinico-brasileiro")

# Filtrar por fonte
medpt = ds["train"].filter(lambda x: x["source"] == "medpt")
sepse = ds["train"].filter(lambda x: x["source"] == "sepse_hcrp")

# Filtrar por especialidade
cardio = ds["train"].filter(lambda x: "Cardiologista" in x["specialty"])

Pipeline de geracao

O dataset e gerado pelo pipeline do repositorio pt-br-clinical-nlp, que baixa, normaliza e unifica os datasets originais em um schema padrao.

Extensibilidade

O pipeline suporta datasets adicionais com acesso credenciado:

DatasetRegistrosAcesso
SemClinBr1.000Credenciado (PUCPR)
BRATECA2.800.000+Credenciado (PhysioNet)

Para incluir esses datasets, siga as instrucoes em pt-br-clinical-nlp.

Citacao

bibtex
@dataset{texto_clinico_brasileiro_2026,
  title={Texto Clinico Brasileiro: Dataset Unificado de Texto Clinico em Portugues para NLP},
  author={Fabiano Filho},
  year={2026},
  url={https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro},
  note={Agrega MedPT e Sepse HC-RP em schema padronizado}
}

Licenca

Codigo do pipeline: MIT. Dados pertencem aos autores originais com suas respectivas licencas.

Autor

LABDAPS -- Laboratorio de Big Data e Analise Preditiva em Saude, FSP-USP

Fabiano Filho -- Medico, Cientista de Dados, Doutorando FSP-USP (LABDAPS)