CoolFace
Datasetpublic

sm1rk/diagnosis-matching-project-data

Diagnosis Matching Dataset Dataset for matching pairs of free-text Russian medical diagnoses. Part of the kilimanj4r0/diagnosis-matching-project. Files File Size Description final-test.csv 55 MB Raw diagnosis pairs (272K rows) final-test-preprocessed.csv 77 MB Cleaned diagnosis pairs rag-diagnosis2icd.json 2.2 MB Diagnosis → ICD-10 mapping (~16K entries) rag-bergamot-index.faiss 51 MB FAISS embedding index for RAG rag-bergamot-index.pkl 3.5 MB… See the full description on the dataset page: https://huggingface.co/datasets/sm1rk/diagnosis-matching-project-data.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes112downloads
Dataset Card

Diagnosis Matching Dataset

Dataset for matching pairs of free-text Russian medical diagnoses. Part of the kilimanj4r0/diagnosis-matching-project.

Files

FileSizeDescription
final-test.csv55 MBRaw diagnosis pairs (272K rows)
final-test-preprocessed.csv77 MBCleaned diagnosis pairs
rag-diagnosis2icd.json2.2 MBDiagnosis → ICD-10 mapping (~16K entries)
rag-bergamot-index.faiss51 MBFAISS embedding index for RAG
rag-bergamot-index.pkl3.5 MBFAISS index metadata
distil-gold.csv538 KBExpert-labeled pairs (4.8K rows)
distil-silver.csv33 MBTeacher-pseudo-labeled pairs (272K rows)
distil-test.csv305 KBTest set with features (1.5K rows)
distil-train-full.csv33 MBGold + silver combined (277K rows)
distil-train-isgold-full.csv33 MBFull train + is_gold flag
distil-train-nondup.csv7.8 MBDeduplicated train (57K rows)
distil-train-isgold-nondup.csv7.7 MBDeduped train + is_gold
distil-train-isgold-preprocessed-nondup.csv7.5 MBFinal training data
ablation-train.csv567 KBFeature-engineered train (4.8K rows)
ablation-test.csv171 KBFeature-engineered test (1.5K rows)

Usage

python
from huggingface_hub import snapshot_download

path = snapshot_download("sm1rk/diagnosis-matching-project-data", repo_type="dataset")
# Access files: path + "/final-test.csv", etc.