YihongJin/Qwen3-Omni-30B-A3B-Instruct-NVFP4-W4A4-full-thinker-awqclip
15.8k
Add B200 perf+accuracy and clarify two-track NaN mitigation (calibration-side ModelOpt fix + load-time vllm-omni#4025 clamp)
Add B200 perf bench (W4A4 +33% tok/s, -29% TPOT at conc=32) + OmniBench accuracy + stability
Add BF16 vs W4A4 Daily-Omni n=1197 comparison (Δ -1.1 pp overall)
Update README with full Daily-Omni n=1197 result + NaN-regression note
Upload W4A4 NVFP4 full-thinker (awq_clip 1024-text) weights
Upload README.md with huggingface_hub
initial commit
