BabyLM-community/BabyLM-Leaderboard-2026
Gating for old entity tracking
Removed the need to fill in custom dataset processing information for multilingual
Merge remote-tracking branch 'origin/main'
Read entity tracking predictions under entity_tracking_filtered key
Refresh leaderboard in-process instead of restarting the Space
Leaderboard: group NLP task columns before human-like ones
Leaderboard: collapse Global PIQA into one macro-averaged column per track, counted once in NLP/zeroshot
AoA: zero legacy scores by gating on the new aoa_surprisals key
Leaderboard: put the three averages first, sort by NLP Average
AoA: tolerate legacy/raw-format results without crashing
Updated Entity Tracking to reflect removal of nothing answers
AoA: read score from submission; drop server-side recompute
Add NLP / Human-like / Overall average columns
Score Hanzi and MECO predictions server-side
update result merging and model linking
use F1 for QQP & MRPC
add POS task
Add hidden tasks support
Revert EWoK size
Fix to EWOK size following fix to EWOK evaluation
allow resubmissions
correctly handle multiling uploads
Merge branch 'main' of https://huggingface.co/spaces/BabyLM-community/BabyLM-Leaderboard-2026
update blimp filtered
add baselines
Validate multilingual predictions file and drop wug_adj/wug_past
update about.py
update predictions button
fix language average
improve column style
improve column style
set default columns
improve col visibility
set multiling col order
update about.py
add multiling logic
remove multilingual-fast track
handle partial submissions better
use last years datasets
set leaderboard loading correctly
pass correct number of submission args
pass correct number of submission args
use correct gr.File setup
allow partial eval
update citation
remove vision tasks
remove multimodal/interaction tracks
Initial commit for BabyLM leaderboard 2026
Initial commit for BabyLM leaderboard 2026
Initial commit for BabyLM leaderboard 2026
