burtenshaw/tailsft-lfm350m-experiment
TailSFT with LFM2.5-350M and Trackio Status, 2026-09-16: GPU preflight completed all three training arms and four evaluations. The strict final-answer grader and namespace/resume checks pass (50 tests). A full-length batch of 256 samples completed on the A100; the full comparison has been submitted. Full experiment results are not yet available. Small, hackable reproduction of the TailSFT filtering method. The objective is higher pass@16 after supervised training. This… See the full description on the dataset page: https://huggingface.co/datasets/burtenshaw/tailsft-lfm350m-experiment.
Experiment complete
random evaluation complete
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
random incremental evaluation
tail evaluation complete
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
tail incremental evaluation
ordinary evaluation complete
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
ordinary incremental evaluation
base evaluation complete
