robailleo/medical-imaging-combined
Combined Medical Imaging Dataset Dataset Description Combined medical imaging dataset with 6793 samples in Alpaca instruction format. Dataset Statistics Total Samples: 6793 Training Samples: 5434 Validation Samples: 1359 Modality Distribution X-ray: 2691 samples CT: 2257 samples Unknown: 1329 samples MRI: 369 samples Ultrasound: 147 samples Source Distribution ROCO: 5000 samples VQA-RAD: 1793 samples… See the full description on the dataset page: https://huggingface.co/datasets/robailleo/medical-imaging-combined.
Combined Medical Imaging Dataset
Dataset Description
Combined medical imaging dataset with 6793 samples in Alpaca instruction format.
Dataset Statistics
- Total Samples: 6793
- Training Samples: 5434
- Validation Samples: 1359
Modality Distribution
- X-ray: 2691 samples
- CT: 2257 samples
- Unknown: 1329 samples
- MRI: 369 samples
- Ultrasound: 147 samples
Source Distribution
- ROCO: 5000 samples
- VQA-RAD: 1793 samples
Sources
- ROCO (Radiology Objects in Context): Medical images with detailed captions
- VQA-RAD: Visual question answering for radiology with expert annotations
Intended Use
- Fine-tuning vision-language models on medical imaging tasks
- Research in medical AI and healthcare applications
- Educational purposes in medical imaging analysis
Format
Each sample follows the Alpaca instruction format:
{
"instruction": "Medical task description",
"input": "Additional context",
"output": "Medical analysis or answer",
"image": "PIL.Image",
"dataset_source": "ROCO or VQA-RAD",
"modality": "Imaging modality"
}Ethical Considerations
- For research purposes only
- Not for clinical decision making
- Comply with medical ethics guidelines
Citation
Please cite the original datasets:
- ROCO: https://huggingface.co/datasets/eltorio/ROCOv2-radiology
- VQA-RAD: https://huggingface.co/datasets/flaviagiammarino/vqa-rad
License
Apache 2.0
