jarrelscy/GLM-5.2-NVFP4-AQLM-hybrid-500k
Retag: vision path gated live end-to-end 2026-07-27 (full context KV, text+image correct); document vision-graft loader fix
Add GLM-5.2-Vision graft: Glm5vForConditionalGeneration config + vision head (MoonViT tower + PatchMerger projector, byte-identical BF16 from baseten) + Kimi processor + vision README. Text shards untouched.
README: note text-only modality + checkpoint parity with 1M flagship
Re-tier deep layers to 1M-flagship parity + refresh AQLM codebooks/scales
docs: point serving fork at shipped branch (GLM cudagraphs-v2 / inkling feature/inkling) + note pinned flashinfer + cutlass-dsl republish guard
Serving: 2026-07-13 promoted stack defaults + measured numbers (77/71/54 short, 49/45/36 @123K)
README: add prefill throughput (~1.2-1.6K tok/s, prefix-cached)
README: fix docker port ->8001:8001; note DCP is a stock vLLM feature
README: fork-based serving (no patching), preferred tp4-1m-mtp @ MAXLEN=500000, drop stale run_rtx6000/patched-vllm + 'speeds unverified' caveat (decode is config-bound), link SERVING.md
Add SERVING.md: current vLLM SM120 launch recipes (tp4-1m-mtp preferred)
Docker section: presets/throughput validated on 1M variant only
Add SM120 Docker deployment section
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
initial commit
