CoolFace
Modelpublic

soundsgoodai/GLM-4.5-Air-NVFP4-KV-cache-BF16

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
0likes24downloads
Model Card

Model Description

A quantization setup used for GLM-4.5-Air:

  • —Weights: NVFP4
  • —KV cache: BF16
  • —Tooling: NVIDIA/Model-Optimizer
  • —Deploy with TensorRT-LLM