datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
DUE-v2-quality-filtered
removed markdown formatting, links, emojis, multiple white spaces
replaced user and channel tags with @user and #channel
deduplicated (not fuzzy only exact)
basic filtering:
word count filter(min_words=3, max_words=200)
mean word length filter(min_mean_word_length=2.0, max_mean_word_length=12.0)
long word filter(max_word_length=200)
whitespace filter (max_white_space_ratio=0.25)
Qwen2.5-3B-Paper-Quality-Filter-Datasetolympiads_math_220k_filtered_single_gen_high_qualitylerobot_datasets_corn_high_quality_50_filter_15lerobot_datasets_corn_high_quality_50_filter_15_sorted_cropedlerobot_datasets_corn_high_quality_50_sorted_filter_15unseen_wildchat_noOOD_fixed_qualityFiltereduplimit-week-1-synthetic-spam-email-data-filtered-qualityfiltered-high-quality-dpo
Filtered High-Quality Instruction-Output Dataset
This dataset contains high-quality (score = 5) instruction-output pairs generated via a reverse instruction generation pipeline using a fine-tuned backward model and evaluated by LLaMA-2-7B-Chat.
Columns
instruction: The generated prompt.
output: The original response.
score: Quality score assigned ( score = 5 retained).
wildchat_data_unused_qualityFiltered_from13000wildchat_data_unused_qualityFiltered_from25000wildchat_data_unused_qualityFiltered_from30000_to35000lima-filtered-high-qualityOpenR1-Math-all-all-traces-quality-repeat-filterwildchat_data_unused_qualityFiltered_from11000filtered_quality_datawildchat_data_unused_qualityFiltered_from8000wildchat_data_unused_qualityFiltered_from8000_to11000wildchat_data_unused_qualityFiltered_from11000_to13000wildchat_data_unused_qualityFiltered_from13000_to25000wildchat_data_unused_qualityFiltered_from30000_to42000wildchat_data_unused_qualityFiltered_from50000_to80000DSAA_6000Q_task3_filtered_high_quality_examples
