CoolFace
Modelpublic

ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes42downloads
Model Card

reasoning-gym-chain-sum-qwen3-0.6b-grpo — GGUF

GGUF quantizations of `ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model`, a GRPO (Group Relative Policy Optimization) reinforcement-learning fine-tune, converted with llama.cpp.

FieldValue
Source checkpoint`ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model`
Base model`Qwen/Qwen3-0.6B`
TrainingGRPO (group-relative RL) on the chain_sum arithmetic-reasoning task
Dataset / environmentOpenEnv `reasoning_gym` — `chain_sum` (agentic env)
Quantization toolllama.cpp convert_hf_to_gguf.py + llama-quantize

Available quantizations

FileSizeNotes
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q4_k_m.gguf397 MB (recommended)4-bit K-quant medium; best size/quality balance
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q5_k_m.gguf444 MB (balanced)5-bit K-quant medium; near-full quality
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q8_0.gguf639 MB (largest)8-bit; closest to the source precision

Recommended default: Q4_K_M. For maximum fidelity use Q8_0.

Usage

llama.cpp

bash
# One-shot
llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF --jinja -p "Your prompt here" -n 256

# Interactive chat
llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF --jinja -cnv

Ollama

bash
ollama run hf.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF:Q4_K_M

llama-cpp-python

python
from llama_cpp import Llama

llm = Llama.from_pretrained(
    repo_id="ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF",
    filename="*q4_k_m.gguf",
    n_ctx=4096,
)
out = llm.create_chat_completion(
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=256,
)
print(out["choices"][0]["message"]["content"])

Intended use

Research and non-commercial experimentation. This model was RL-tuned on the chain_sum arithmetic-reasoning task; it is a reasoning demonstrator, not a general-purpose assistant. Verify outputs before any downstream use.

Limitations

  • —GGUF quantizations carry unavoidable quality loss relative to the source weights; prefer Q8_0 when fidelity matters.
  • —Inherits every limitation of the source checkpoint (`ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model`).
  • —Optimized for the chain_sum arithmetic-reasoning task; capability on unrelated tasks is not guaranteed.

Citation

bibtex
@misc{reasoning_gym_chain_sum_qwen3_0_6b_grpo_gguf,
  author       = {Ermia Azarkhalili},
  title        = {reasoning-gym-chain-sum-qwen3-0.6b-grpo — GGUF quantized},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF}}
}