CoolFace
Modelpublic

astom-M/lora-sft-v12

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes8downloads
Model Card

lora-sft-v12

Qwen3-4B-Instruct-2507 をベースとした LoRA アダプタです。構造化データ出力(JSON, YAML, TOML, CSV, XML)の精度向上を目的にファインチューニングしています。

Model Details

  • Base Model: Qwen/Qwen3-4B-Instruct-2507
  • Method: LoRA + rsLoRA (Rank-Stabilized LoRA)
  • Framework: PEFT / Transformers / BitsAndBytes (4-bit QLoRA)
  • Dataset: u-10bei/structureddatawithcotdataset512v2

Training Hyperparameters

ParameterValue
LoRA rank (r)64
LoRA alpha128
rsLoRATrue
Target modulesqproj, kproj, vproj, oproj, gateproj, upproj, down_proj
Epochs1
Learning rate2e-6
Effective batch size32 (micro=2, accum=16)
Max sequence length512
Precisionbf16
Quantization4-bit NF4 + double quant
OptimizerAdamW
Warmup ratio0.1
Weight decay0.05

Usage