CoolFace
Modelpublic

soundsgoodai/GLM-4.5-Air-NVFP4-KV-cache-FP8

sourceHugging Faceapache-2.0updated 9mo agoView on Hugging Face
0likes31downloads
Model Card

Model Description

A quantization setup used for GLM-4.5-Air:

  • —Weights: NVFP4
  • —KV cache: FP8
  • —Tooling: NVIDIA/Model-Optimizer

Deploy with TensorRT-LLM