datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Light-Omni-Training
Light-Omni Training Dataset
This repository contains the training data used by Light-Omni, a multimodal
agent framework for reflexive video understanding with long-term memory.
Light-Omni uses memory-augmented multimodal streams to train adapters for
memory construction, response generation, and reaction/action control.
Links
Project page: https://clare-nie.github.io/Light-Omni/
Code: https://github.com/Clare-Nie/Light-Omni
Dataset:… See the full description on the dataset page: https://huggingface.co/datasets/ClareNie/Light-Omni-Training.mj1-training-clean
MJ1 Training Data
Training data for MJ1 (MultiModal Judge 1) - a multimodal reward model for evaluating vision-language model outputs.
Dataset Summary
MJ1 Training Data is a curated, multi-source preference dataset designed for training a multimodal judge capable of evaluating responses across text and image modalities. Every datapoint contains at least one image and covers three distinct evaluation scenarios:
Prompt image + text responses (reason) - Given an image and a… See the full description on the dataset page: https://huggingface.co/datasets/haizelabs/mj1-training-clean.laser_gui_grounding_training_dataABot-PhysWorld_SFT_Training_Data_v1PottsMPNN_Training_MSAs
Paired & Monomer MSA Database
This repository contains multiple sequence alignments (MSAs) and the mapping
files needed to associate them with PDB complexes.
Contents
File
Size
Description
PDB_paired_msas.tar.zst.part_aa … part_af
~10.7 GB each
Sharded, zstd-compressed tar archive of the paired PDB MSAs (.a3m files).
cath42_msas.tar.gz
13.3 GB
Gzip-compressed tar archive of the CATH 4.2 MSAs.
cid_mapping.pkl
7.84 MB
Dictionary mapping PDB chain IDs… See the full description on the dataset page: https://huggingface.co/datasets/FosterBirnbaum/PottsMPNN_Training_MSAs.madqa-training
Chrisyichuan/madqa-training
MADQA document QA contrastive training data with hard negatives.
Contents
madqa_converted.jsonl — query-image pairs with hard negatives
images/ — all referenced images
Each metadata row:
{
"query": "...",
"chunk_path": "images/...",
"neg_chunk_paths": ["images/...", "images/..."],
"source_positive_rank": 0,
"source_positive_score": 0.0,
"source_dataset": "moca"
}
Summary
rows: 1840
unique images: 3598
avg… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/madqa-training.tamil_nadu_v4_trainingtraining_jsonDiff-training-testmoca-visrag-ind-training
Chrisyichuan/moca-visrag-ind-training
MOCA VisRAG independent-split contrastive training data with hard negatives.
Contents
moca_visrag_ind_converted.jsonl — query-image pairs with hard negatives
images/ — all referenced images
Each metadata row:
{
"query": "...",
"chunk_path": "images/...",
"neg_chunk_paths": ["images/...", "images/..."],
"source_positive_rank": 0,
"source_positive_score": 0.0,
"source_dataset": "moca"
}
Summary
rows: 122752… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-visrag-ind-training.moca-colpali-training
Chrisyichuan/moca-colpali-training
MOCA ColPali contrastive training data with hard negatives.
Contents
moca_colpali_converted.jsonl — query-image pairs with hard negatives
images/ — all referenced images
Each metadata row:
{
"query": "...",
"chunk_path": "images/...",
"neg_chunk_paths": ["images/...", "images/..."],
"source_positive_rank": 0,
"source_positive_score": 0.0,
"source_dataset": "moca"
}
Summary
rows: 118195
unique… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-colpali-training.Charles-training-data
Training data for Charles - The first AI NFT
Buy Charles at https://bioniq.io/collection/charles/ordinals
Training data
Created using scripts in: https://github.com/onicai/Charles
data/*.json
in same format as the Dataset roneneldan/TinyStories
training_dataABot-PhysWorld_SFT_Training_Data_v1_RoboMINDmoca-visrag-syn-training
Chrisyichuan/moca-visrag-syn-training
MOCA VisRAG synthetic-split contrastive training data with hard negatives.
Contents
moca_visrag_syn_converted.jsonl — query-image pairs with hard negatives
images/ — all referenced images
Each metadata row:
{
"query": "...",
"chunk_path": "images/...",
"neg_chunk_paths": ["images/...", "images/..."],
"source_positive_rank": 0,
"source_positive_score": 0.0,
"source_dataset": "moca"
}
Summary
rows: 239206… See the full description on the dataset page: https://huggingface.co/datasets/Chrisyichuan/moca-visrag-syn-training.image_token_training_Lumina
Image Token Training Sets
This repository contains public training token files for internal research / experimentation.
Contents
COCO_Janus_tokens_for_train/
laion_Lumina7B_tokens_for_train/
midjourney_Lumina7B_tokens_for_train/
File format
Each subset contains .pt files.
Notes
The files are provided as precomputed training artifacts.
Consumers should load them with PyTorch.
Directory structure is preserved as-is.
StableCascade_Lora_Training_sampletraining_datacineleum-training-datamusiq-training-data
