sonawat-sambudh-tft/llama-3.2-1b-ml-intern-sft-lora-quick
04
Llama-3.2-1B ML-Intern SFT LoRA Quick
LoRA adapter fine-tuned from `unsloth/Llama-3.2-1B-Instruct` on the prepared local ML-Intern session-log dataset `sonawat-sambudh-tft/ml-intern-llama-sft-data`.
This is a quick validated run performed on local CPU constraints: 2 training rows, 1 optimizer step, max length 512. It proves the end-to-end fine-tuning, logging, save, push, and reload path. For a production run, use the script in this repo with GPU/QLoRA and the full dataset.
Metrics
- train_loss:
2.9789 - step:
1 - base model:
unsloth/Llama-3.2-1B-Instruct - adapter method: LoRA (
r=32,alpha=16, dropout0.05)
Trackio dashboard: https://huggingface.co/spaces/sonawat-sambudh-tft/ml-intern-llama-sft-trackio
Usage
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base = "unsloth/Llama-3.2-1B-Instruct"
adapter = "sonawat-sambudh-tft/llama-3.2-1b-ml-intern-sft-lora-quick"
tokenizer = AutoTokenizer.from_pretrained(adapter)
model = AutoModelForCausalLM.from_pretrained(base, dtype=torch.float16, device_map="auto")
model = PeftModel.from_pretrained(model, adapter)
messages = [{"role": "user", "content": "Hi"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt", return_dict=True).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(outputs[0], skip_special_tokens=False))