CoolFace
Modelpublic

soundsgoodai/GLM-4.7-NVFP4-KV-cache-BF16

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
0likes22downloads
Model Card

A quantization setup used for GLM-4.7:

  • —Weights: NVFP4
  • —KV cache: BF16
  • —Tooling: NVIDIA/Model-Optimizer
  • —Deploy with TensorRT-LLM