CoolFace
Modelpublic

nooruiit-864/qwen2.5-1.5b-base-ai-safety-domain-lora

sourceHugging Faceapache-2.0updated 13d agoView on Hugging Face
0likes147downloads
Model Card

Qwen2.5-1.5B — Deepfake/Misinformation Domain-Adapted (Merged)

Model Description

This model is a merged version of a QLoRA-fine-tuned adapter on top of Qwen/Qwen2.5-1.5B (base variant). The adapter was trained via domain adaptation on an AI Safety / Deepfake Misinformation corpus, then merged into the base weights using merge_and_unload() for standalone deployment (no separate adapter needed at inference time).

Training Lineage

  • —Base model: Qwen/Qwen2.5-1.5B
  • —Fine-tuning method: QLoRA (4-bit NF4 quantization during training, double quantization, paged optimizer)
  • —Domain corpus: AI Safety / Deepfake Misinformation
  • —Adapter merge: peft.PeftModel.merge_and_unload()
  • —Training framework: transformers==4.46.3, trl==0.12.2, peft==0.13.2

Recommended Usage: 4-bit Quantized Inference

For memory-efficient deployment, load this model with bitsandbytes NF4 quantization (the same setup used in our benchmarking):

python
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
import torch

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_quant_type="nf4",
    bnb_4bit_compute_dtype=torch.float16,
    bnb_4bit_use_double_quant=True,
)

model = AutoModelForCausalLM.from_pretrained(
    "nooruiit-864/qwen2.5-1.5b-base-ai-safety-domain-lora",
    quantization_config=bnb_config,
    device_map="auto",
)
tokenizer = AutoTokenizer.from_pretrained("nooruiit-864/qwen2.5-1.5b-base-ai-safety-domain-lora")

Benchmark Results (Colab T4 GPU)

Model VariantWeights SizeAvg Latency (s)Tokens/secPeak GPU Memory (GB)
Base model (FP16, no adapter)~2960 MB2.47924.23.103
Unmerged LoRA (base + adapter, FP16)~2960 MB + adapter3.7339.643.176
Merged + Quantized (4-bit NF4)2959.6 MB → 1099.1 MB2.41914.881.164

Key takeaway: The merged+quantized variant reduces peak GPU memory by ~62% versus the base model, while retaining domain-adapted knowledge and reasonable inference speed — the recommended variant for memory-constrained deployment.

Limitations

  • —Domain adaptation may exhibit mild catastrophic forgetting on general-purpose tasks (observed during Day 30 evaluation).
  • —Benchmarks were run on a single T4 GPU with do_sample=False, batch size 1; results may vary on other hardware/settings.

Intended Use

Educational / research use for studying domain-adapted LLM behavior on AI safety and misinformation-related text generation.