CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01Amshaker /Mobile-O-Post-Train Mobile-O Post-Training Data Unified Multimodal Post-Training · ~105K Quadruplet Samples 📌 Overview This dataset is used for Stage 3: Unified Multimodal Post-Training of Mobile-O, a unified multimodal model for on-device understanding and generation. The goal of this stage is to jointly improve both image generation and visual understanding through a multi-task objective using quadruplet samples. 📊 Dataset Format Each sample is a quadruplet consisting of:… See the full description on the dataset page: https://huggingface.co/datasets/Amshaker/Mobile-O-Post-Train.imagetext-to-image1K<n<10K13 likes6.7k downloads7mo agoHugging Face02Amshaker /Mobile-O-Pre-Train Mobile-O Pre-Training Data Cross-Modal Alignment · 9M Text-Image Pairs 📌 Overview This dataset is used for Stage 1: Cross-Modal Alignment pre-training of Mobile-O, a unified multimodal model for on-device understanding and generation. The goal of this stage is to align the DiT diffusion decoder and Mobile Conditioning Projector (MCP) with the frozen VLM backbone using large-scale text-image pairs. 📊 Dataset Composition Source Samples Description… See the full description on the dataset page: https://huggingface.co/datasets/Amshaker/Mobile-O-Pre-Train.imagetext-to-image10M<n<100M12 likes2.6k downloads7mo agoHugging Face03ASLP-lab /Easy-Turn-Trainset Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems Guojian Li1, Chengyou Wang1, Hongfei Xue1, Shuiyuan Wang1, Dehui Gao1, Zihan Zhang2, Yuke Lin2, Wenjie Li2, Longshuai Xiao2, Zhonghua Fu1,╀, Lei Xie1,╀ 1 Audio, Speech and Language Processing Group (ASLP@NPU), Northwestern Polytechnical University 2 Huawei Technologies, China 🎤 Demo Page 🤖 Easy Turn Model 📑 Paper 🌐 Huggingface… See the full description on the dataset page: https://huggingface.co/datasets/ASLP-lab/Easy-Turn-Trainset.imageautomatic-speech-recognition1K<n<10K12 likes1.3k downloads11mo agoHugging Face04Uni-Edit /Uni-Edit-Train-Data Uni-Edit Training Data: Uni-Edit-148k Project Page | GitHub Repository | Paper 👀 Intro We introduce Uni-Edit, an intelligent image editing task that serves as the first general task for Unified Multimodal Model (UMM) tuning. Unlike conventional mixed multi-task training that suffers from inherent task conflicts and requires complex multi-stage pipelines, Uni-Edit breaks this paradigm. It achieves true mutual reinforcement by improving image… See the full description on the dataset page: https://huggingface.co/datasets/Uni-Edit/Uni-Edit-Train-Data.imageany-to-any1K<n<10K3 likes1.1k downloads4mo agoHugging Face05zhang0jhon /Aesthetic-Train-V2 Aesthetic-Train-V2 Dataset We introduce Aesthetic-Train-V2, a high-quality traing set for ultra-high-resolution image generation. For more details, please refer to our paper: Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models (CVPR 2025) Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation Source code is available at https://github.com/zhang0jhon/diffusion-4k. Citation If you find our paper or dataset is helpful in your… See the full description on the dataset page: https://huggingface.co/datasets/zhang0jhon/Aesthetic-Train-V2.image10K<n<100K13 likes989 downloads1y agoHugging Face06fanrui00 /FakeVV_trainsetimage100K<n<1M0 likes450 downloads10mo agoHugging Face07tbuckley /synthetic-derm-1M-trainimage100K<n<1M1 likes420 downloads2y agoHugging Face08Viglong /OriAnyV2_Train_Render Orient Anything V2 Dataset Project Page | Paper | GitHub Orient Anything V2 is an enhanced foundation model for unified understanding of object 3D orientation and rotation from single or paired images. This repository contains the training data (final rendering data) used for the model. Sample Usage Below is a snippet to run inference using the model and data logic, as found in the official GitHub repository: import numpy as np from PIL importImage import torch import… See the full description on the dataset page: https://huggingface.co/datasets/Viglong/OriAnyV2_Train_Render.imageother1M<n<10M6 likes247 downloads8mo agoHugging Face09haizelabs /mj1-training-clean MJ1 Training Data Training data for MJ1 (MultiModal Judge 1) - a multimodal reward model for evaluating vision-language model outputs. Dataset Summary MJ1 Training Data is a curated, multi-source preference dataset designed for training a multimodal judge capable of evaluating responses across text and image modalities. Every datapoint contains at least one image and covers three distinct evaluation scenarios: Prompt image + text responses (reason) - Given an image and a… See the full description on the dataset page: https://huggingface.co/datasets/haizelabs/mj1-training-clean.imageimage-text-to-text100K<n<1M0 likes244 downloads8mo agoHugging Face10AI-QWQ-AI /dan-new-webp-trainimage1M<n<10M0 likes183 downloads1y agoHugging Face11qqer /laser_gui_grounding_training_dataimage100K<n<1M0 likes183 downloads1y agoHugging Face12jasonhuang23 /sd2.1_base_trainimage10K<n<100K0 likes94 downloads3y agoHugging Face13LPY /BridgeVLA_RLBench_TRAIN_DATAarxiv: https://arxiv.org/abs/2506.07961 image1M<n<10M0 likes63 downloads1y agoHugging Face14Chrisyichuan /madqa-training Chrisyichuan/madqa-training MADQA document QA contrastive training data with hard negatives. Contents madqa_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 1840 unique images: 3598 avg… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/madqa-training.imagequestion-answering1K<n<10K0 likes60 downloads6mo agoHugging Face15hjvsl /GeoZero_Train_Datasets SFT and RL Traning dataset of GeoZero Dataset Composition GeoZero consists of three variants: File Description GeoZero-Raw.json Raw aggregated data across heterogeneous datasets GeoZero-Instruct.json Unified instruction-tuned dataset for supervised fine-tuning GeoZero-Hard.json Challenging subset for RL training All image files are stored under the images/ directory. Directory Structure GeoZero_Train_Datasets/ ├── images/ │ ├──… See the full description on the dataset page: https://huggingface.co/datasets/hjvsl/GeoZero_Train_Datasets.imagevisual-question-answering100K<n<1M2 likes58 downloads7mo agoHugging Face16k-nick /vr_train_vr1image1M<n<10M0 likes50 downloads10mo agoHugging Face17gurumurthy3 /tamil_nadu_v4_trainingimage10K<n<100K0 likes43 downloads6mo agoHugging Face18SunAhKim0430 /slidevqa_trainimage10K<n<100K0 likes42 downloads4mo agoHugging Face190x3 /Easy-Turn-Trainset Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems Guojian Li1, Chengyou Wang1, Hongfei Xue1, Shuiyuan Wang1, Dehui Gao1, Zihan Zhang2, Yuke Lin2, Wenjie Li2, Longshuai Xiao2, Zhonghua Fu1,╀, Lei Xie1,╀ 1 Audio, Speech and Language Processing Group (ASLP@NPU), Northwestern Polytechnical University 2 Huawei Technologies, China 🎤 Demo Page 🤖 Easy Turn Model 📑 Paper 🌐 Huggingface… See the full description on the dataset page: https://huggingface.co/datasets/0x3/Easy-Turn-Trainset.imageautomatic-speech-recognition1K<n<10K0 likes38 downloads4mo agoHugging Face20keshavagarwal2004dev /GeoZero_Train_Datasets SFT and RL Traning dataset of GeoZero Dataset Composition GeoZero consists of three variants: File Description GeoZero-Raw.json Raw aggregated data across heterogeneous datasets GeoZero-Instruct.json Unified instruction-tuned dataset for supervised fine-tuning GeoZero-Hard.json Challenging subset for RL training All image files are stored under the images/ directory. Directory Structure GeoZero_Train_Datasets/ ├── images/ │ ├──… See the full description on the dataset page: https://huggingface.co/datasets/keshavagarwal2004dev/GeoZero_Train_Datasets.imagevisual-question-answering100K<n<1M0 likes31 downloads7mo agoHugging Face21Shio-Koube /Diff-training-testimage100K<n<1M0 likes28 downloads1y agoHugging Face22Chrisyichuan /moca-visrag-ind-training Chrisyichuan/moca-visrag-ind-training MOCA VisRAG independent-split contrastive training data with hard negatives. Contents moca_visrag_ind_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 122752… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-visrag-ind-training.imagequestion-answering100K<n<1M0 likes25 downloads6mo agoHugging Face23Chrisyichuan /moca-colpali-training Chrisyichuan/moca-colpali-training MOCA ColPali contrastive training data with hard negatives. Contents moca_colpali_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 118195 unique… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-colpali-training.imagequestion-answering100K<n<1M1 likes25 downloads6mo agoHugging Face24Chrisyichuan /moca-visrag-syn-training Chrisyichuan/moca-visrag-syn-training MOCA VisRAG synthetic-split contrastive training data with hard negatives. Contents moca_visrag_syn_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 239206… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-visrag-syn-training.imagequestion-answering100K<n<1M0 likes18 downloads6mo agoHugging Face25zeyuren2002 /nuscene-360_trainimage100K<n<1M0 likes14 downloads5mo agoHugging Face26SangMin9806 /train_2wikimultihopqaimage10K<n<100K0 likes12 downloads4mo agoHugging Face27trainfanlhy /lhy_docvqa_dataimage10K<n<100K0 likes11 downloads2y agoHugging Face28fansunqi /web-dataset_3_screenshot_rendered_train_mhtml_3image10K<n<100K0 likes11 downloads8mo agoHugging Face29fansunqi /web-dataset_4_screenshot_rendered_train_mhtml_4image1K<n<10K0 likes9 downloads8mo agoHugging Face30amanm10000 /amazon-ml-challenge-trainimagen<1K0 likes7 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.