datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
router_SFT_larger_model_generated_data_mmlu_pro_science_Qwen3-4B_aimerouter_SFT_larger_model_generated_data_mmlu_pro_science_Qwen3-14Brouter_SFT_larger_model_generated_data_mmlu_pro_science_OLMo-2-1124-13B-Instructrouter_SFT_larger_model_generated_data_mmlu_pro_science_OLMo-2-1124-7B-Instructrouter_SFT_larger_model_generated_data_mmlu_pro_science_Meta-Llama-3-8B-Instructrouter_SFT_larger_model_generated_data_mmlu_pro_science_Qwen3-4Brouter_SFT_larger_model_generated_data_mmlu_pro_science_Qwen3-8Brouter_SFT_larger_model_generated_data_mmlu_pro_science_Qwen3-0.6Brouter_SFT_larger_model_generated_data_mmlu_pro_science_Qwen3-1.7Bmodel_generated_summariesTrain split consist of 100,000 model generated summaries. Validation and Test split each consist of 20000 model generated summaries.
For each domain and each model, there are 5,000 training, 1,000 validation, and 1,000 test samples
Domain:
-News (source document retrieved from https://huggingface.co/datasets/abisee/cnn_dailymail)
-Arxiv research articles (source document retrieved from https://huggingface.co/datasets/ccdv/arxiv-summarization)
-Reddit posts (source document retrieved from… See the full description on the dataset page: https://huggingface.co/datasets/yujin31/model_generated_summaries.
