CoolFace
Datasetpublic

reasoning-degeneration-dev/t1-strategy-musr-baseline-qwen3-80b-thinking-musr-base

t1-strategy-musr-baseline-qwen3-80b-thinking-musr-base Strategy compliance evaluation on MuSR murder mysteries — baseline variant. Model received standard MuSR cot+ prompt (baseline control). Judge still scores against criterion-first rubric. Compliance is scored by an LLM judge (1-5 Likert) against the Criterion-First rubric. Results Metric Value pass@1 0.9000 Strategy compliance (mean) 2.00 Strategy compliance (min) 2 Strategy compliance (max) 2… See the full description on the dataset page: https://huggingface.co/datasets/reasoning-degeneration-dev/t1-strategy-musr-baseline-qwen3-80b-thinking-musr-base.

sourceHugging Facemitupdated 7mo agoView on Hugging Face
0likes8downloads
3 commits on main
30006a07mo ago

Upload README.md with huggingface_hub

zsprague
73e1fc37mo ago

Upload dataset

zsprague
2695a4b7mo ago

initial commit

zsprague