CoolFace
Modelpublic

sonawat-sambudh-tft/llama-3.2-1b-ml-intern-sft-lora-quick

sourceHugging Facellama3.2updated 5mo agoView on Hugging Face
0likes4downloads
Model Card

Llama-3.2-1B ML-Intern SFT LoRA Quick

LoRA adapter fine-tuned from `unsloth/Llama-3.2-1B-Instruct` on the prepared local ML-Intern session-log dataset `sonawat-sambudh-tft/ml-intern-llama-sft-data`.

This is a quick validated run performed on local CPU constraints: 2 training rows, 1 optimizer step, max length 512. It proves the end-to-end fine-tuning, logging, save, push, and reload path. For a production run, use the script in this repo with GPU/QLoRA and the full dataset.

Metrics

  • —train_loss: 2.9789
  • —step: 1
  • —base model: unsloth/Llama-3.2-1B-Instruct
  • —adapter method: LoRA (r=32, alpha=16, dropout 0.05)

Trackio dashboard: https://huggingface.co/spaces/sonawat-sambudh-tft/ml-intern-llama-sft-trackio

Usage

python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

base = "unsloth/Llama-3.2-1B-Instruct"
adapter = "sonawat-sambudh-tft/llama-3.2-1b-ml-intern-sft-lora-quick"

tokenizer = AutoTokenizer.from_pretrained(adapter)
model = AutoModelForCausalLM.from_pretrained(base, dtype=torch.float16, device_map="auto")
model = PeftModel.from_pretrained(model, adapter)

messages = [{"role": "user", "content": "Hi"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt", return_dict=True).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(outputs[0], skip_special_tokens=False))

Training script

See `scripts/train_llama_sft.py`.