meteorain/Qwen3-4B-Thinking-2507-llmc-gptq-w4a16-g128-n256-s2048
08
Qwen3-4B-Thinking-2507-llmc-gptq-w4a16-g128-n256-s2048
Base model: Qwen/Qwen3-4B-Thinking-2507
Quantized with llm-compressor.
- method:
gptq - weight format:
W4A16 - group size:
128 - calibration dataset:
nvidia/Llama-Nemotron-Post-Training-Dataset - calibration split:
math - calibration samples:
256 - max sequence length:
2048
