lifeart/smart-home-sft-v2
B4 stage 2: synth-distillation training set
B4: v6+v9 greedy candidate calls
B4: clean-schema-only candidate-gen source (2500 rows)
B4: synth-distill candidate-gen source (3k full-task rows)
bench v1 + v2 on sh_test.json
Iter 40: v15 targeted-augmentation training mix (v9 + 2.6k failure-driven rows x3)
ONNX fp32/fp16/q8 accuracy bench on sh_test
Iter 36 long-context bench (v9/v13/v14 x buckets)
Iter 36: long-context training mix (78k v9 originals + 22k schema-padded long rows, 1024-4096 tok)
Iter 36: long-context test set (300 short + 172x3 length buckets)
bench v1 + v2 on sh_test.json
bench v1 + v2 on sh_test.json
bench v1 + v2 on sh_test.json
ONNX fp32/fp16/q8 accuracy bench on sh_test
ONNX fp32/fp16/q8 accuracy bench on sh_test
ONNX fp32/fp16/q8 accuracy bench on sh_test
iter32: synth v2 best config 78.7%
iter23 H1.2 constrained bench (v6+v9)
iter23 H1.2 constrained bench (v6+v9)
iter24: v6r-args dataset (16515 args_only rows from 19084 v6r SH base)
iter23 H1.2 constrained bench (v6+v9)
iter23: tool_registry.json for cloud bench
bench v1 + v2 on sh_test.json
iter15.4 — cross-domain bench v4/v5/v6 on 100-item external holdout
iter22.2: v11 pure-data-scaling (27579 rows) — v6(20600) + HA×1(2021) + Nemotron×1(4958), NO Granite
bench v1 + v2 on sh_test.json
iter15.4 — cross-domain bench v4/v5/v6 on 100-item external holdout
iter21.1: v10 selective Granite (56689 rows) — SH×3(12672->38016) + non-SH×1(6412) + HA×1(2021) + Nemotron×1(4958) + v7add×1(5282)
bench v1 + v2 on sh_test.json
iter15.4 — cross-domain bench v4/v5/v6 on 100-item external holdout
bench v1 + v2 on sh_test.json
iter20.1: v9 Granite-relabel (78189 rows = 3 × 26063 base)
iter20.1: v9 base (26063 rows) — v6r + 2021 HA + 4958 Nemotron
iter15.4 — cross-domain bench v4/v5/v6 on 100-item external holdout
bench v1 + v2 on sh_test.json
iter17.4: v8 train input = v7r refined (24366 rows)
iter17.3: v7r = v6r + refined v7-additions (24366 rows)
iter17.2: refinement meta (KEEP/FIX/DROP buckets + sample fixes)
iter17.2: refined v6 via Llama-3.3-70B (19084 rows, -1516 unrecoverable)
iter15.4 — cross-domain bench v4/v5/v6 on 100-item external holdout
iter16.1: drop 1 row containing token-shaped string (push protection)
iter16.1: v7 dataset (25883 rows) — v6 + 2995 ToolACE + 1959 xLAM + 329 Glaive
bench v1 + v2 on sh_test.json
iter15.4 — cross-domain bench v4/v5/v6 on 100-item external holdout
Iter 15.2 — external holdout (100 items, stratified across 9 categories)
Iter 15.2 — v6 = v5 + 590 fresh_bench items (universal tool-call mix)
bench v1 + v2 on sh_test.json
bench v1 + v2 on sh_test.json
Iter 13.4 — v5 dataset = v4 + HF-Inference synthetic (Llama-3.3-70B)
Iter 13.3 — 3000 synthetic items from Llama-3.3-70B
