datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
CIMA-4.8-ADR
CIMA Sección 4.8 — Reacciones Adversas
Corpus de texto biomédico regulatorio en español compuesto por la
sección 4.8 ("Reacciones adversas") de la totalidad de las fichas
técnicas publicadas por la
Agencia Española de Medicamentos y Productos Sanitarios (AEMPS)
en su Centro de Información Online de Medicamentos
(CIMA).
Este recurso fue construido como base para el pre-entrenamiento
adaptado al dominio (continued pre-training / domain-adaptive
pre-training, DAPT) de modelos… See the full description on the dataset page: https://huggingface.co/datasets/guerrerotook/CIMA-4.8-ADR.CIMD
Chinese Instruction Multimodal Data (CIMD)
The dataset contains one million Chinese image-text pairs in total, including detailed image captioning and visual question answering.
Generation Pipeline
Image source
We randomly sample images from two opensource datasets Wanjuan and Wukong
Detailed caption generation
We use Gemini Pro Vision API to generate a detailed description for each image.
Question-answer pairs generation
Based on the generated caption, we use Gemini… See the full description on the dataset page: https://huggingface.co/datasets/jingzi/CIMD.
