datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
merged_speech_datasetvqa_plant-disease-classification-merged-datasetmerged_vietnamese_instruction_datasetmerged-datasets_11-12
Merged Datasets 11-12
This dataset is a compilation of various sources filtered for length and quality.
Statistics
Dataset
Language
Count
Mean Len
Median Len
Max Len
Min Len
Ba2han/synth-tr
Turkish
33,416
2874
2692
17714
400
Ba2han/synth-2m-v2
Turkish
2,065,969
2894
2718
110664
358
Ba2han/filtered-cosmos
Turkish
785,340
4987
4646
11000
1000
Ba2han/fineweb2-filtered-tr
Turkish
5,896,067
5853
5265
15000
304
Ba2han/finePDF-filtered-tr
Turkish
124,223
8294… See the full description on the dataset page: https://huggingface.co/datasets/Ba2han/merged-datasets_11-12.loggenix-merged-dataset-v1merged-yolo-datasetmerged-bambara-dioula-datasetindo-merged-dataset-2
Dataset Card for "indo-merged-dataset-2"
More Information needed
merged_sft_datasetmerged-hindi-audio-datasetmerged_fin_dataset_v2gex_dataset_mergedmerged-bambara-dioula-datasetmerged_financial_datasetmerged_english_accent_datasetPreference_Dataset_Merged
Dataset Overview
This Dataset consists of the following open-sourced preference dataset
Arena Human Preference
Anthropic HH
MT-Bench Human Judgement
Ultra Feedback
Tulu3 Preference Dataset
Skywork-Reward-Preference-80K-v0.2
Cleaning
Cleaning Method 1: Only keep the following Language using FastText language detection(EN/DE/ES/ZH/IT/JA/FR)
Cleaning Method 2: Remove duplicates to ensure each prompt appears only once
Cleaning Method 3: Remove datasets where… See the full description on the dataset page: https://huggingface.co/datasets/yufan/Preference_Dataset_Merged.Merged_Luo_Datasetpersian-ocr-community-dataset-layout-mergedloggenix-merged-dataset
============================================================
TOKEN STATISTICS ANALYSIS
📊 OVERALL DATASET STATISTICS
────────────────────────────────────────
Total samples: 2,419,111
Total tokens in dataset: 2,052,945,533
Average tokens per sample: 848.64
📈 TOKEN DISTRIBUTION
────────────────────────────────────────
Min tokens: 21
Max tokens: 142,971
Median tokens: 534.00
Standard deviation: 1047.89
📊 TOKEN PERCENTILES
────────────────────────────────────────
5th percentile: 83… See the full description on the dataset page: https://huggingface.co/datasets/kshitijthakkar/loggenix-merged-dataset.medical_qa_dataset_mergedmerged_african_speech_datasetmerged_chat_datasetSTRIX_3_dataset_merged
mad-esc50-drone-audio
Dataset audio fusionné à partir de 3 sources, normalisé pour la classification audio (colonnes : audio, label, source_dataset, split).
Sources et attributions
MAD (Military Audio Dataset) — Kim, Yoon & Jung, 2024, Scientific Data. CC BY 4.0.
https://www.kaggle.com/datasets/junewookim/mad-dataset-military-audio-dataset
ESC-50 — Karol J. Piczak. CC BY-NC 3.0 (usage non commercial).
https://github.com/karolpiczak/ESC-50
DroneAudioDataset —… See the full description on the dataset page: https://huggingface.co/datasets/Newton2676/STRIX_3_dataset_merged.merged_fin_dataset_v1MindGamesArena-Merged-Datasetarabic_ocr_merged_datasetMerged_datasetmerged-PMEmo2019-lyric-audio-valence-new-regressor-test-datasetmerged_datasetMerged_Nepali_Health_FAQ_Dataset
Merged Nepali Health FAQ Dataset (Multi-Source)
Overview
This dataset (merged_nepali_sharegpt_after_removing_11_groups_keep_ids.jsonl) is a merged collection of 65 instruction-following conversation pairs in Nepali, combining Q&A content from 8 distinct real-world Nepali health institutions and organizations into a single ShareGPT-style file. Each record is a single-turn human↔gpt exchange: a Nepali-language question followed by a factual Nepali-language answer.… See the full description on the dataset page: https://huggingface.co/datasets/sabin1234/Merged_Nepali_Health_FAQ_Dataset.
