datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
PILE_Wikipedia_Pretraining_subset_100k-distill-syn_knowledgetuluv2-expanded-150k-insert-ret-tokens-outputs-inject_syn-knowledge-outputs-part_v0PILE_Wikipedia_Pretraining_subset_10k-distill_syn-knowledgetulu-v2-sft-mixture-llama3-inference-syn-knowledge-outputs-v1PILE_Wikipedia_validation_set_synthetic_knowledgeopen-hermes-2.5-sft-mixture-llama3-inference-syn-knowledge-outputs-v1PILE_Wikipedia_Pretraining_subset_100k-distill-syn_knowledge-valid-setPILE_Wikipedia_Pretraining_subset_valid_ret_tokens_syn_knowledge_ouputstuluv2-mini-insert-ret-tokens-outputs-inject_syn-knowledge-output
