CoolFace
Modelpublic

tinyopsec/MiniCPM5-2B-SFT-Pashto-GGUF

sourceHugging Faceapache-2.0updated 12d agoView on Hugging Face
1likes1.2kdownloads
Model Card

MiniCPM5-2B-SFT-Pashto-GGUF

GGUF quantizations of nassimjp/MiniCPM5-2B-SFT-Pashto, a fine-tuned version of openbmb/MiniCPM5-2B for Pashto language.

Quant Table

FileBitsEst. SizeUse Case
model_f16.gguf16~4.6 GBReference / re-quantization
modelq80.gguf8~2.4 GBMax quality, enough RAM
modelq6k.gguf6~1.9 GBHigh quality
modelq5k_m.gguf5~1.6 GBBalanced
modelq5k_s.gguf5~1.6 GBBalanced, smaller
modelq4k_m.gguf4~1.4 GBRecommended
modelq4k_s.gguf4~1.3 GBLower RAM
modelq3k_l.gguf3~1.1 GBLow RAM
modelq3k_m.gguf3~1.0 GBLow RAM
modelq3k_s.gguf3~0.9 GBMinimum quality
modelq2k.gguf2~0.7 GBVery low RAM only

VRAM / RAM Requirements

QuantRAM
Q8_0~3 GB
Q4KM~2 GB
Q2_K~1.5 GB

Usage

llama.cpp

bash
./llama-cli -m model_q4_k_m.gguf -p "Your prompt here" -n 256

llama-cpp-python

python
from llama_cpp import Llama
llm = Llama(model_path="model_q4_k_m.gguf")
output = llm("Your prompt here", max_tokens=256)
print(output["choices"][0]["text"])

LM Studio

Download any .gguf file and load directly in LM Studio.

Ollama

bash
ollama run hf.co/tinyopsec/MiniCPM5-2B-SFT-Pashto-GGUF:Q4_K_M

Notes

  • —Architecture: LlamaForCausalLM
  • —Fine-tuned for Pashto (پښتو) language
  • —Based on MiniCPM5-2B with hybrid reasoning (Think / No-Think modes)
  • —For llama.cpp, recommended: --min-p 0.0 to avoid repetition