CoolFace
13 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01LianeMarilin /CADBench-Extended-Multimodal-Dataset Dataset Card Dataset Description CADBench Extended Multimodal Dataset is an independently produced public extension for multimodal CAD reconstruction research. It contains 100 CAD samples with clean and perturbed meshes, STEP/STL/OBJ/GLB representations, single-view and four-view renders, PBR images, bilingual descriptions, prompt variants, QA, geometry metadata, grading signals, and manually reviewed visual semantics. Tasks: image-to-text, text-to-image… See the full description on the dataset page: https://huggingface.co/datasets/LianeMarilin/CADBench-Extended-Multimodal-Dataset.3dimage-to-textn<1K1 likes1.7k downloads21d agoHugging Face02FreedomIntelligence /Medical_Multimodal_Evaluation_Data Evaluation Guide This dataset is used to evaluate medical multimodal LLMs, as used in HuatuoGPT-Vision. It includes benchmarks such as VQA-RAD, SLAKE, PathVQA, PMC-VQA, OmniMedVQA, and MMMU-Medical-Tracks. To get started: Download the dataset and extract the images.zip file. Find evaluation code on our GitHub: HuatuoGPT-Vision. This open-source release aims to simplify the evaluation of medical multimodal capabilities in large models. Please cite the relevant benchmark… See the full description on the dataset page: https://huggingface.co/datasets/FreedomIntelligence/Medical_Multimodal_Evaluation_Data.imageimage-to-text10K<n<100K29 likes346 downloads2y agoHugging Face03RKB109 /multimodal-document-retrieval-20260911-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260911-dataset.textvisual-document-retrievaln<1K0 likes59 downloads12d agoHugging Face04RKB109 /multimodal-document-retrieval-20260901-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260901-dataset.textvisual-document-retrievaln<1K0 likes56 downloads22d agoHugging Face05RKB109 /multimodal-document-retrieval-20260921-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260921-dataset.textvisual-document-retrievaln<1K0 likes37 downloads2d agoHugging Face06RKB109 /multimodal-document-retrieval-20260812-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260812-dataset.textvisual-document-retrievaln<1K0 likes28 downloads1mo agoHugging Face07RKB109 /multimodal-document-retrieval-20260822-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260822-dataset.textvisual-document-retrievaln<1K0 likes28 downloads1mo agoHugging Face08RKB109 /multimodal-document-retrieval-20260802-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260802-dataset.textvisual-document-retrievaln<1K0 likes26 downloads2mo agoHugging Face09RKB109 /multimodal-document-retrieval-20260723-dataset Multimodal Document Retrieval Baseline Synthetic Dataset Summary This dataset contains 14 training examples and 4 held-out examples for Business documents contain meaning in text, tables, layout, and imagery that text-only retrieval can miss. Every record is synthetic and includes: input: query, event, or feature description label: expected class, route, relation, or evidence category context: synthetic supporting context source: fictional source identifier… See the full description on the dataset page: https://huggingface.co/datasets/RKB109/multimodal-document-retrieval-20260723-dataset.textvisual-document-retrievaln<1K0 likes14 downloads2mo agoHugging Face10EmpathicRobotics /multimodal-test-datagatedtext100K<n<1M0 likes9 downloads3y agoHugging Face11achiepatricia /han-multimodal-context-fusion-dataset-v1 Humanoid Multi-Modal Context Fusion Dataset This dataset captures fused environmental signals from multiple sensory channels across humanoid agents. It includes visual context tags, audio event signatures, proximity readings, and semantic environment labels. Objective To support context-aware intelligence through multi-modal signal integration. Data Fields node_id visual_context_vector audio_signature_hash proximity_reading semantic_environment_label… See the full description on the dataset page: https://huggingface.co/datasets/achiepatricia/han-multimodal-context-fusion-dataset-v1.textn<1K0 likes8 downloads7mo agoHugging Face12Multilingual-Multimodal-NLP /CrossOIE-Datasettext10K<n<100K3 likes5 downloads3y agoHugging Face13hsuya /data_multimodalgatedimageimage-to-textn<1K0 likes2 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.