CoolFace
20 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01ClareNie /Light-Omni-Training Light-Omni Training Dataset This repository contains the training data used by Light-Omni, a multimodal agent framework for reflexive video understanding with long-term memory. Light-Omni uses memory-augmented multimodal streams to train adapters for memory construction, response generation, and reaction/action control. Links Project page: https://clare-nie.github.io/Light-Omni/ Code: https://github.com/Clare-Nie/Light-Omni Dataset:… See the full description on the dataset page: https://huggingface.co/datasets/ClareNie/Light-Omni-Training.audiovisual-question-answering100K<n<1M3 likes692 downloads3mo agoHugging Face02haizelabs /mj1-training-clean MJ1 Training Data Training data for MJ1 (MultiModal Judge 1) - a multimodal reward model for evaluating vision-language model outputs. Dataset Summary MJ1 Training Data is a curated, multi-source preference dataset designed for training a multimodal judge capable of evaluating responses across text and image modalities. Every datapoint contains at least one image and covers three distinct evaluation scenarios: Prompt image + text responses (reason) - Given an image and a… See the full description on the dataset page: https://huggingface.co/datasets/haizelabs/mj1-training-clean.imageimage-text-to-text100K<n<1M0 likes244 downloads8mo agoHugging Face03qqer /laser_gui_grounding_training_dataimage100K<n<1M0 likes191 downloads1y agoHugging Face04huangyuan123 /ABot-PhysWorld_SFT_Training_Data_v1text100K<n<1M0 likes168 downloads5mo agoHugging Face05FosterBirnbaum /PottsMPNN_Training_MSAs Paired & Monomer MSA Database This repository contains multiple sequence alignments (MSAs) and the mapping files needed to associate them with PDB complexes. Contents File Size Description PDB_paired_msas.tar.zst.part_aa … part_af ~10.7 GB each Sharded, zstd-compressed tar archive of the paired PDB MSAs (.a3m files). cath42_msas.tar.gz 13.3 GB Gzip-compressed tar archive of the CATH 4.2 MSAs. cid_mapping.pkl 7.84 MB Dictionary mapping PDB chain IDs… See the full description on the dataset page: https://huggingface.co/datasets/FosterBirnbaum/PottsMPNN_Training_MSAs.text100K<n<1M0 likes123 downloads3mo agoHugging Face06Chrisyichuan /madqa-training Chrisyichuan/madqa-training MADQA document QA contrastive training data with hard negatives. Contents madqa_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 1840 unique images: 3598 avg… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/madqa-training.imagequestion-answering1K<n<10K0 likes59 downloads5mo agoHugging Face07gurumurthy3 /tamil_nadu_v4_trainingimage10K<n<100K0 likes43 downloads5mo agoHugging Face08WeiXiCZ /training_jsontextn<1K0 likes33 downloads10mo agoHugging Face09Shio-Koube /Diff-training-testimage100K<n<1M0 likes28 downloads1y agoHugging Face10Chrisyichuan /moca-visrag-ind-training Chrisyichuan/moca-visrag-ind-training MOCA VisRAG independent-split contrastive training data with hard negatives. Contents moca_visrag_ind_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 122752… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-visrag-ind-training.imagequestion-answering100K<n<1M0 likes25 downloads5mo agoHugging Face11Chrisyichuan /moca-colpali-training Chrisyichuan/moca-colpali-training MOCA ColPali contrastive training data with hard negatives. Contents moca_colpali_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 118195 unique… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-colpali-training.imagequestion-answering100K<n<1M1 likes24 downloads5mo agoHugging Face12onicai /Charles-training-data Training data for Charles - The first AI NFT Buy Charles at https://bioniq.io/collection/charles/ordinals Training data Created using scripts in: https://github.com/onicai/Charles data/*.json in same format as the Dataset roneneldan/TinyStories textn<1K0 likes22 downloads2y agoHugging Face13luuuulinnnn /training_datatext10K<n<100K0 likes19 downloads4mo agoHugging Face14ryanhoangt /ABot-PhysWorld_SFT_Training_Data_v1_RoboMINDtext10K<n<100K0 likes19 downloads4mo agoHugging Face15Chrisyichuan /moca-visrag-syn-training Chrisyichuan/moca-visrag-syn-training MOCA VisRAG synthetic-split contrastive training data with hard negatives. Contents moca_visrag_syn_converted.jsonl — query-image pairs with hard negatives images/ — all referenced images Each metadata row: { "query": "...", "chunk_path": "images/...", "neg_chunk_paths": ["images/...", "images/..."], "source_positive_rank": 0, "source_positive_score": 0.0, "source_dataset": "moca" } Summary rows: 239206… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-visrag-syn-training.imagequestion-answering100K<n<1M0 likes16 downloads5mo agoHugging Face16vlgunsdaddy /image_token_training_Lumina Image Token Training Sets This repository contains public training token files for internal research / experimentation. Contents COCO_Janus_tokens_for_train/ laion_Lumina7B_tokens_for_train/ midjourney_Lumina7B_tokens_for_train/ File format Each subset contains .pt files. Notes The files are provided as precomputed training artifacts. Consumers should load them with PyTorch. Directory structure is preserved as-is. texttext-to-image10K<n<100K0 likes10 downloads7mo agoHugging Face17WillisBack /StableCascade_Lora_Training_sampleimagen<1K0 likes5 downloads3y agoHugging Face18tangliwei /training_datatextn<1K0 likes3 downloads8mo agoHugging Face19HaaDeej /cineleum-training-dataimagen<1K0 likes3 downloads4mo agoHugging Face20adam-thebrandinghouse-co /musiq-training-datatext10K<n<100K0 likes1 downloads7mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.