CoolFace
Datasetpublic

teeyouteeyou/medical-imaging-combined

Combined Medical Imaging Dataset Dataset Description Combined medical imaging dataset with 6793 samples in Alpaca instruction format. Dataset Statistics Total Samples: 6793 Training Samples: 5434 Validation Samples: 1359 Modality Distribution X-ray: 2691 samples CT: 2257 samples Unknown: 1329 samples MRI: 369 samples Ultrasound: 147 samples Source Distribution ROCO: 5000 samples VQA-RAD: 1793 samples… See the full description on the dataset page: https://huggingface.co/datasets/teeyouteeyou/medical-imaging-combined.

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
2likes61downloads
Dataset Card

Combined Medical Imaging Dataset

Dataset Description

Combined medical imaging dataset with 6793 samples in Alpaca instruction format.

Dataset Statistics

  • —Total Samples: 6793
  • —Training Samples: 5434
  • —Validation Samples: 1359

Modality Distribution

  • —X-ray: 2691 samples
  • —CT: 2257 samples
  • —Unknown: 1329 samples
  • —MRI: 369 samples
  • —Ultrasound: 147 samples

Source Distribution

  • —ROCO: 5000 samples
  • —VQA-RAD: 1793 samples

Sources

  1. 1.ROCO (Radiology Objects in Context): Medical images with detailed captions
  2. 2.VQA-RAD: Visual question answering for radiology with expert annotations

Intended Use

  • —Fine-tuning vision-language models on medical imaging tasks
  • —Research in medical AI and healthcare applications
  • —Educational purposes in medical imaging analysis

Format

Each sample follows the Alpaca instruction format:

json
{
  "instruction": "Medical task description",
  "input": "Additional context",
  "output": "Medical analysis or answer",
  "image": "PIL.Image",
  "dataset_source": "ROCO or VQA-RAD",
  "modality": "Imaging modality"
}

Ethical Considerations

  • —For research purposes only
  • —Not for clinical decision making
  • —Comply with medical ethics guidelines

Citation

Please cite the original datasets:

  • —ROCO: https://huggingface.co/datasets/eltorio/ROCOv2-radiology
  • —VQA-RAD: https://huggingface.co/datasets/flaviagiammarino/vqa-rad

License

Apache 2.0