CoolFace
Modelpublic

Ayodele01/Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-GGUF

sourceHugging Facegemmaupdated 4mo agoView on Hugging Face
2likes429downloads
Model Card

Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-GGUF

GGUF quantized versions of Ayodele01/Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill.

Model Description

This is Google's Gemma-4 12B instruction-tuned model, fine-tuned on the full 25,000 synthetic reasoning examples dataset WithinUsAI/gemini_3.5_flash_distilled_25k using QLoRA via Unsloth.

This GGUF model contains quantized versions of the merged model weights.

Available Files and Quantizations

FilenameQuant TypeSizeDescription
Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-bf16.ggufBF16~24.4 GBFull precision, best quality
Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-Q8_0.ggufQ8_0~12.2 GBHigh quality, minimal degradation
Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-Q5_K_M.ggufQ5KM~8.3 GBBalanced (recommended)
Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-Q4_K_M.ggufQ4KM~7.2 GBGood quality, smaller size

Usage with llama.cpp

You can run these files using llama.cpp.

bash
# Run with llama-cli
./llama-cli -m Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill-Q5_K_M.gguf \
  -p "<|turn>user\nWhat is the sum of all prime numbers between 1 and 50?<|turn>model\n" \
  -n 512

Prompt Template

Gemma-4 chat template format:

text
<|turn>user
{ prompt }<|turn>model

Training and Distillation Context

For details on evaluations, training hyperparameters, and qualitative findings, please refer to the main repository model card: Ayodele01/Gemma-4-12B-Gemini-3.5-flash-Reasoning-Distill.