inference-optimization/dflash-DeepSeek-V4-Flash-all-swa-muon-speculators-50k
246
Remove partial_rotary_factor (no-op: trainer uses full rotary)
Upload README.md with huggingface_hub
Upload val_metrics.json with huggingface_hub
Upload config.py with huggingface_hub
Upload config.json with huggingface_hub
Upload model.safetensors with huggingface_hub
initial commit
