reasoning-degeneration-dev/algo-sft-cellular-automata-step-simulation-d5
06
Cellular Automata — Step Simulation
LoRA adapter for Qwen/Qwen2.5-1.5B-Instruct fine-tuned on cellular automata via Algorithmic Template SFT.
Part of the Algorithmic SFT vs Distillation experiment studying whether deterministic algorithmic templates teach procedural reasoning more effectively than distillation from large reasoning models.
Training
Evaluation (v3, MAX_TOKENS=32768)
Notes
Learned to read and apply any rule from lookup table. Generalizes to novel rules (72% OOD) but struggles with multi-step on larger grids (3.4% harder).
Usage
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
model = PeftModel.from_pretrained(base, "reasoning-degeneration-dev/algo-sft-cellular-automata-step-simulation-d5")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")Related Datasets
- Training data (63K algo traces)
- Distillation data (24K QwQ traces)
- Eval results (aggregate scores)
- Eval questions (11K test/val/harder/OOD)
