CoolFace
Modelpublic

lqfdjbf32n/Qwen3-4B-Stage1

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes33downloads
Model Card

Qwen3-4B — Stage 1 (General Foundation)

A 4B parameter model fine-tuned on ~308k mixed samples covering general chat, instruction following, math, coding, and factual QA. This is Stage 1 of a multi-stage training pipeline built on top of Qwen3-4B.

Model Details

  • —Base Model: unsloth/Qwen3-4B
  • —Parameters: 4B
  • —Architecture: Qwen3 (dense, pure text)
  • —Training: LoRA fine-tune → merged
  • —License: Apache 2.0
  • —Language: English (multilingual base)

Files

FileDescription
adapter_model.safetensorsLoRA adapter weights (unmerged)
adapter_config.jsonLoRA configuration
qwen4b-s1-Q4_K_M.ggufQuantized GGUF (Q4KM, ~2.4GB)
tokenizer.jsonTokenizer

Training Details

Dataset Mix (~308k samples)

DatasetSamplesPurpose
open-thoughts/OpenThoughts-114k113,957Reasoning / Chain-of-thought
teknium/OpenHermes-2.530,000General chat
HuggingFaceH4/ultrachat_200k30,000Conversation
WizardLM/WizardLMevolinstructV2196k20,000Instruction following
nvidia/OpenMathInstruct-250,000Math
AI-MO/NuminaMath-CoT20,000Math competition
hotpot_qa10,000Multi-hop QA
squad_v28,000Factual QA
trivia_qa5,000Factual QA
google-research-datasets/natural_questions5,000Factual QA
google-research-datasets/mbpp374Coding
iamtarun/pythoncodeinstructions18kalpaca5,000Coding
bigcode/self-oss-instruct-sc2-exec-filter-50k10,000Coding

Total: ~308k samples, 2 epochs

Hyperparameters

ParameterValue
LoRA rank64
LoRA alpha64
Learning rate1e-4 cosine
Epochs2
Sequence length4096
Batch size4 (effective 32)
Optimizeradamw_8bit
Final loss0.4861

Hardware

Trained on AMD Instinct MI300X (192GB VRAM), ROCm 6.2.4, Unsloth 2026.3.3, PyTorch 2.7.1+rocm6.2.4. Runtime: ~16.3 hours.

Usage

Ollama (GGUF)

ollama run hf.co/lqfdjbf32n/Qwen3-4B-Stage1:Q4_K_M

llama.cpp

bash
llama-cli -m qwen4b-s1-Q4_K_M.gguf \
    -p "<|im_start|>system\nYou are a helpful assistant.<|im_end|>\n<|im_start|>user\nYour question here<|im_end|>\n<|im_start|>assistant\n" \
    -n 512

Python (LoRA adapter)

python
from unsloth import FastLanguageModel
from peft import PeftModel
import torch

model, tokenizer = FastLanguageModel.from_pretrained(
    "unsloth/Qwen3-4B",
    max_seq_length=4096,
    dtype=torch.bfloat16,
    load_in_4bit=False,
)
model = PeftModel.from_pretrained(model, "lqfdjbf32n/Qwen3-4B-Stage1")
model = model.merge_and_unload()

Limitations

  • —Stage 1 only — general foundation, not reasoning-specialized
  • —English primary (multilingual via base model)
  • —Not suitable for production without validation
  • —Complex multi-step reasoning may still fail

Part of a Series

ModelDescription
Qwen2.5-0.5B-ReasonChat0.5B edge model, reasoning + chat merged
Qwen3-4B-Stage14B general foundation (this model)
Qwen3-4B-Stage24B + Claude reasoning injection (coming soon)