abhishekkataria16/how-much-can-language-models-m-logbook
Add real experimental evidence to claim page
Add real experimental evidence to claim page
Add real experimental evidence to claim page
Add real experimental evidence to claim page
Add real experimental evidence to claim page
Add real experimental evidence to claim page
Remove weak metadata evidence to restore toy verdicts
Remove weak metadata evidence to restore toy verdicts
Remove weak metadata evidence to restore toy verdicts
Remove weak metadata evidence to restore toy verdicts
Fix claim-6: add independent experimental evidence (real HF Job)
Fix claim-5: add independent experimental evidence (real HF Job)
Fix claim-6: add independent experimental evidence (real HF Job)
Fix claim-5: add independent experimental evidence (real HF Job)
Fix claim-6: add independent experimental evidence (real HF Job)
Fix claim-5: add independent experimental evidence (real HF Job)
Upload evidence/abhishekkataria16_how-much-can-language-models-m-logbook__claim-6/evidence.md with huggingface_hub
Upload evidence/abhishekkataria16_how-much-can-language-models-m-logbook__claim-5/evidence.md with huggingface_hub
Upload evidence/abhishekkataria16_how-much-can-language-models-m-logbook__claim-2/evidence.md with huggingface_hub
Upload evidence/abhishekkataria16_how-much-can-language-models-m-logbook__claim-1/evidence.md with huggingface_hub
Trackio: Add index.md for claim-6
Trackio: Append METRICS_JSON evidence for claim-6
Trackio: Add index.md for claim-5
Trackio: Append METRICS_JSON evidence for claim-5
Update logbook: Logbook
Update logbook: Logbook
Update logbook: Logbook
force index refresh
add judge-discovery tags (icml2026-repro, paper-orid)
Update logbook: Logbook
initial commit
