datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
medmcqa_train_translated_es_with_chunks_es_kb_None_7000_dense_with_options_reformatted_contextmedmcqa-itThis dataset is presented in
@misc{ferrazzi2025groundedmultilingualmedicalreasoning,
title={Grounded Multilingual Medical Reasoning for Question Answering with Large Language Models},
author={Pietro Ferrazzi and Aitor Soroa and Rodrigo Agerri},
year={2025},
eprint={2512.05658},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2512.05658},
}
medmcqa-filtered-v16
MedMCQA Filtered v16
This commit adds normalized source explanations to official validation for a
mixed gold-rationale-assisted likelihood evaluation. The immutable training
revision remains 29cf55f62c523dc9c1c45e2d77f52208058e7d19; evaluation clients must pin the
full SHA of this commit separately.
Splits
Split
Rows
Contract
train
63,316
Byte-logically unchanged from the training revision
tuning
5,000
Byte-logically unchanged from the training… See the full description on the dataset page: https://huggingface.co/datasets/hanseungwook/medmcqa-filtered-v16.medmcqa-enThis dataset is presented in
@misc{ferrazzi2025groundedmultilingualmedicalreasoning,
title={Grounded Multilingual Medical Reasoning for Question Answering with Large Language Models},
author={Pietro Ferrazzi and Aitor Soroa and Rodrigo Agerri},
year={2025},
eprint={2512.05658},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2512.05658},
}
medmcqa-esThis dataset is presented in
@misc{ferrazzi2025groundedmultilingualmedicalreasoning,
title={Grounded Multilingual Medical Reasoning for Question Answering with Large Language Models},
author={Pietro Ferrazzi and Aitor Soroa and Rodrigo Agerri},
year={2025},
eprint={2512.05658},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2512.05658},
}
medmcqa-cpv
MedMCQA CPV
Counterfactual Patient Variations of the MedMCQA validation split,
created to measure demographic bias in LLMs for clinical decision-making.
Paper
Benkirane et al. "How Can We Diagnose and Treat Bias in Large Language Models
for Clinical Decision-Making?" NAACL 2025. arXiv:2410.16574
Bias Representation: Before vs. After CPV
Aspect
Before (original MedMCQA)
After (CPV expansion)
Patient demographics
Absent — questions typically do not… See the full description on the dataset page: https://huggingface.co/datasets/kenza-ily/medmcqa-cpv.distill-sub-medmcqa-13Bmedmcqa-enmedmcqa-esmedmcqa-itMedMCQACancermed_mcqa_vignettesMedMCQA-filteredQwen3-medmcqa
