CoolFace
Modelpublic

jarrelscy/GLM-5.2-NVFP4-AQLM-hybrid-500k

sourceHugging Facemitupdated 2mo agoView on Hugging Face
2likes33downloads
17 commits on main
5c68e6c2mo ago

Retag: vision path gated live end-to-end 2026-07-27 (full context KV, text+image correct); document vision-graft loader fix

jarrelscy
2401d5c2mo ago

Add GLM-5.2-Vision graft: Glm5vForConditionalGeneration config + vision head (MoonViT tower + PatchMerger projector, byte-identical BF16 from baseten) + Kimi processor + vision README. Text shards untouched.

jarrelscy
29f3c812mo ago

README: note text-only modality + checkpoint parity with 1M flagship

jarrelscy
aa091472mo ago

Re-tier deep layers to 1M-flagship parity + refresh AQLM codebooks/scales

jarrelscy
1f2c8b42mo ago

docs: point serving fork at shipped branch (GLM cudagraphs-v2 / inkling feature/inkling) + note pinned flashinfer + cutlass-dsl republish guard

jarrelscy
ac1a6383mo ago

Serving: 2026-07-13 promoted stack defaults + measured numbers (77/71/54 short, 49/45/36 @123K)

jarrelscy
2db24f53mo ago

README: add prefill throughput (~1.2-1.6K tok/s, prefix-cached)

jarrelscy
79486d63mo ago

README: fix docker port ->8001:8001; note DCP is a stock vLLM feature

jarrelscy
28ff2f03mo ago

README: fork-based serving (no patching), preferred tp4-1m-mtp @ MAXLEN=500000, drop stale run_rtx6000/patched-vllm + 'speeds unverified' caveat (decode is config-bound), link SERVING.md

jarrelscy
67600e33mo ago

Add SERVING.md: current vLLM SM120 launch recipes (tp4-1m-mtp preferred)

jarrelscy
c69a1523mo ago

Docker section: presets/throughput validated on 1M variant only

jarrelscy
3ce15913mo ago

Add SM120 Docker deployment section

jarrelscy
007a33c3mo ago

Add files using upload-large-folder tool

jarrelscy
4a06d4a3mo ago

Add files using upload-large-folder tool

jarrelscy
09e71f83mo ago

Add files using upload-large-folder tool

jarrelscy
97d29d93mo ago

Add files using upload-large-folder tool

jarrelscy
b37408d3mo ago

initial commit

jarrelscy