CoolFace
Modelpublic

ghecko78/Voxtral-Small-24B-2507-W4A16

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
1likes72downloads
Model Card

Voxtral-Small-24B-2507-W4A16-GPTQ

Model Overview

  • —Model Architecture: VoxtralForConditionalGeneration
  • —Input: Audio-Text
  • —Output: Text
  • —Model Optimizations:
  • —Weight quantization: INT4 (4-bit, GPTQ)
  • —Activation quantization: FP16 (16-bit, unquantized)
  • —Quantization Scheme: W4A16 GPTQ
  • —Calibration Dataset: C4 (English) — 256 samples, max 2048 tokens
  • —Release Date: 03/27/2026
  • —Version: 1.0
  • —Model Developers: ghecko

Description

Quantized version of Voxtral-Small-24B-2507 using W4A16 GPTQ quantization via llmcompressor.

4-bit weight quantization significantly reduces model size and memory requirements while preserving audio understanding, transcription, and translation capabilities.

Quantization Details

  • —Method: GPTQ (one-shot, weight-only)
  • —Scheme: W4A16 — 4-bit integer weights, 16-bit floating-point activations
  • —Dampening: 0.1
  • —Ignored layers: lm_head, audio tower, multimodal projector (kept in original precision)

Usage

With Transformers

python
import torch
from transformers import VoxtralForConditionalGeneration, AutoProcessor

model_id = "ghecko78/Voxtral-Small-24B-2507-W4A16-GPTQ"

model = VoxtralForConditionalGeneration.from_pretrained(
    model_id,
    device_map="auto",
    dtype=torch.float16,
)
processor = AutoProcessor.from_pretrained(model_id)

With vLLM

python
from vllm import LLM

model = LLM(
    model="ghecko78/Voxtral-Small-24B-2507-W4A16-GPTQ",
    max_model_len=4096,
)

Creation

Created using the following quantization recipe:

python
from llmcompressor.modifiers.quantization import GPTQModifier

recipe = GPTQModifier(
    targets="Linear",
    scheme="W4A16",
    ignore=["language_model.lm_head", "re:audio_tower.*", "re:multi_modal_projector.*"],
    dampening_frac=0.1,
)

See the full quantization script: `scripts/quantize.py`