soundsgoodai/GLM-4.5-Air-NVFP4-KV-cache-FP8
031
Model Description
A quantization setup used for GLM-4.5-Air:
- Weights: NVFP4
- KV cache: FP8
- Tooling: NVIDIA/Model-Optimizer
Deploy with TensorRT-LLM
A quantization setup used for GLM-4.5-Air:
Deploy with TensorRT-LLM