datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
dataset_merged_preprocesssed_v2
Dataset Card for "dataset_merged_preprocesssed_v2"
More Information needed
merged_speech_datasetvqa_plant-disease-classification-merged-datasetdataset_challenge_mergeddataset_merged_3src_20260429_augmerged_vietnamese_instruction_datasetmerged_datasetloggenix-merged-dataset-v1merged-dataset-4096merged_datasetThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v2.0",
"robot_type": "rainbow",
"total_episodes": 70,
"total_frames": 10360,
"total_tasks": 1,
"total_videos": 0,
"total_chunks": 1,
"chunks_size": 1000,
"fps": 30,
"splits": {
"train": "0:70"
},
"data_path": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/ccop/merged_dataset.merged-yolo-datasetTPSoSe2026_Dataset_Full_Merged_Final_LeRobot_SO101_V1
SO-101 Multi-Task Dataset — 930 episodes (merged, final)
The primary training dataset for Project-IRA: 930 teleoperated SO-101 episodes across four manipulation tasks, with 93 distinct English prompt phrasings. Every multi-task model in the organization was trained on this dataset.
Part of Project-IRA — Interactive Robotic Arm.
Code: https://github.com/Project-IRA/interactive-robotic-arm
Episodes
930
Distinct task prompts
93
LeRobot codebase version
v3.0
Robot… See the full description on the dataset page: https://huggingface.co/datasets/Project-IRA/TPSoSe2026_Dataset_Full_Merged_Final_LeRobot_SO101_V1.merged-bambara-dioula-datasetindo-merged-dataset-2
Dataset Card for "indo-merged-dataset-2"
More Information needed
merged-dataset-10244_wx250s_merge_datasetThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v2.1",
"robot_type": "4_wx250s",
"total_episodes": 50,
"total_frames": 21174,
"total_tasks": 1,
"total_videos": 50,
"total_chunks": 1,
"chunks_size": 1000,
"fps": 30,
"splits": {
"train": "0:50"
},
"data_path": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/ROBOTIS-junha/4_wx250s_merge_dataset.merged_sft_datasetmerged-dataset-dual-20251114
Kentaro/merged-dataset-dual-20251114
This dataset is a merge of the following datasets:
Kentaro/record-mkj_0
Kentaro/merged-dataset-dual-002-006
Dataset Statistics
Total episodes: 33
Total frames: 20203
Source Datasets Details
Kentaro/record-mkj_0
Episodes: 13
Frames: 8321
Kentaro/merged-dataset-dual-002-006
Episodes: 20
Frames: 11882
merged-hindi-audio-datasetmerged_fixedpos_datasetThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"fps": 30,
"features": {
"action": {
"dtype": "float32",
"shape": [
6
],
"names": [
"shoulder_pan.pos",
"shoulder_lift.pos",
"elbow_flex.pos",
"wrist_flex.pos",
"wrist_roll.pos",
"gripper.pos"… See the full description on the dataset page: https://huggingface.co/datasets/Farzatci/merged_fixedpos_dataset.merged_datasetmerged_fin_dataset_v2merged_fixedpos_dataset_v2This dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"fps": 30,
"features": {
"action": {
"dtype": "float32",
"shape": [
6
],
"names": [
"shoulder_pan.pos",
"shoulder_lift.pos",
"elbow_flex.pos",
"wrist_flex.pos",
"wrist_roll.pos",
"gripper.pos"… See the full description on the dataset page: https://huggingface.co/datasets/Farzatci/merged_fixedpos_dataset_v2.Merged_dataset_3gex_dataset_mergedmerged-bambara-dioula-datasetmerged_financial_datasetmerged_english_accent_datasetadaptive-dice-maestro-dataset-mergedPreference_Dataset_Merged
Dataset Overview
This Dataset consists of the following open-sourced preference dataset
Arena Human Preference
Anthropic HH
MT-Bench Human Judgement
Ultra Feedback
Tulu3 Preference Dataset
Skywork-Reward-Preference-80K-v0.2
Cleaning
Cleaning Method 1: Only keep the following Language using FastText language detection(EN/DE/ES/ZH/IT/JA/FR)
Cleaning Method 2: Remove duplicates to ensure each prompt appears only once
Cleaning Method 3: Remove datasets where… See the full description on the dataset page: https://huggingface.co/datasets/yufan/Preference_Dataset_Merged.
