reasoning-degeneration-dev/t1-strategy-musr-counterfactual-qwen3-80b-thinking-musr-cfact
t1-strategy-musr-counterfactual-qwen3-80b-thinking-musr-cfact Strategy compliance evaluation on MuSR murder mysteries — counterfactual-hypothesis variant. Model was instructed to use Counterfactual Hypothesis Testing with Early Termination (assume each suspect is guilty, test conditions, stop at first contradiction). Compliance is scored by an LLM judge (1-5 Likert) against the Criterion-First rubric. Results Metric Value pass@1 0.9000 Strategy… See the full description on the dataset page: https://huggingface.co/datasets/reasoning-degeneration-dev/t1-strategy-musr-counterfactual-qwen3-80b-thinking-musr-cfact.
t1-strategy-musr-counterfactual-qwen3-80b-thinking-musr-cfact
Strategy compliance evaluation on MuSR murder mysteries — counterfactual-hypothesis variant.
Model was instructed to use Counterfactual Hypothesis Testing with Early Termination (assume each suspect is guilty, test conditions, stop at first contradiction). Compliance is scored by an LLM judge (1-5 Likert) against the Criterion-First rubric.
Results
Compliance Distribution
Details
Usage
from datasets import load_dataset
ds = load_dataset("reasoning-degeneration-dev/t1-strategy-musr-counterfactual-qwen3-80b-thinking-musr-cfact", split="train")
scores = ds["strategy_compliance"]
print(f"Mean compliance: {sum(scores) / len(scores):.2f}")Tracked in [reasoning-degeneration-dev/PROJECT-MANIFEST](https://huggingface.co/datasets/reasoning-degeneration-dev/PROJECT-MANIFEST)
