babylm-anon/stratified_10m_curriculum
Dataset Card for Stratified 10M Curriculum This is a stratified split by domain of the raw datasets used by the 2024 BabyLM challange. Sampled from the original datasets, equal amounts of tokens for each stage (C1,...C5). Child-directed speech accounts for nearly half of the original dataset by word count. In preliminary experiments using a training data influence estimation method, this category was by far the most influential. This dataset enables us to investigate whether… See the full description on the dataset page: https://huggingface.co/datasets/babylm-anon/stratified_10m_curriculum.
Upload roberta_incr_influence_epoch_repetition.pt with huggingface_hub
Upload llama_incr_influence_epoch_repetition.pt with huggingface_hub
Upload roberta_influence_decr_bins_lognorm.pt with huggingface_hub
Upload roberta_influence_tracin_sandwich.pt with huggingface_hub
Upload roberta_influence_top_50_cp_shuffled.pt with huggingface_hub
Upload roberta_influence_decr_cp_dirac.pt with huggingface_hub
Upload roberta_influence_incr_cp_dirac.pt with huggingface_hub
Upload roberta_influence_incr_bins_lognorm.pt with huggingface_hub
Upload roberta_influence_decr_bins_dirac.pt with huggingface_hub
Upload roberta_influence_incr_bins_dirac.pt with huggingface_hub
Upload roberta_influence_epoch_repetition.pt with huggingface_hub
Upload llama_influence_tracin_sandwich.pt with huggingface_hub
Upload llama_influence_top_50_cp_shuffled.pt with huggingface_hub
Upload llama_influence_decr_cp_lognorm.pt with huggingface_hub
Upload llama_influence_incr_cp_lognorm.pt with huggingface_hub
Upload llama_influence_decr_cp_dirac.pt with huggingface_hub
Upload llama_influence_incr_cp_dirac.pt with huggingface_hub
Upload llama_influence_decr_bins_lognorm.pt with huggingface_hub
Upload llama_influence_incr_bins_lognorm.pt with huggingface_hub
Upload llama_influence_decr_bins_dirac.pt with huggingface_hub
Upload llama_influence_incr_bins_dirac.pt with huggingface_hub
Upload llama_influence_epoch_repetition.pt with huggingface_hub
Upload llama_influence_epoch_repetition.pt with huggingface_hub
Upload source_difficulty.pt with huggingface_hub
Upload mattr_increasing.pt with huggingface_hub
Upload perplexity_increasing.pt with huggingface_hub
Rename curriculum.pt to source_difficulty.pt
Upload mattr_increasing.pt with huggingface_hub
Upload perplexity_increasing.pt with huggingface_hub
Upload random.pt with huggingface_hub
Upload influential_examples_sandwich_llama.pt with huggingface_hub
Upload influential_examples_first_third_llama.pt with huggingface_hub
Upload influential_examples_first_half_llama.pt with huggingface_hub
Upload influential_examples_early_llama.pt with huggingface_hub
Upload influential_examples_first_half_llama.pt with huggingface_hub
Upload influential_examples_early_llama.pt with huggingface_hub
Upload dirac_positive_only_llama.pt with huggingface_hub
Upload dirac_llama.pt with huggingface_hub
Upload lognorm_top_50_pct_shuffled_llama.pt with huggingface_hub
Upload lognorm_top_50_pct_llama.pt with huggingface_hub
Upload lognorm_llama.pt with huggingface_hub
Upload influential_examples_early.pt with huggingface_hub
Upload influential_examples_sandwich.pt with huggingface_hub
Upload influential_examples_first_third.pt with huggingface_hub
Upload influential_examples_early.pt with huggingface_hub
Upload influential_examples_first_half.pt with huggingface_hub
Upload influential_examples_first_half.pt with huggingface_hub
Upload influential_examples_first_half.pt with huggingface_hub
Upload lognorm_top_50_pct_twice_shuffled.pt with huggingface_hub
Upload top_90_full_epoch_shuffled.pt with huggingface_hub
