CoolFace
Modelpublic

markankamaransheogarat/qwen2.5-3b-supportops-lora

sourceHugging Faceupdated 8d agoView on Hugging Face
0likes22downloads
Model Card

SupportOps-Qwen2.5-3B-LoRA

LoRA-адаптер для модели Qwen/Qwen2.5-3B-Instruct, дообученный на задаче классификации инцидентов техподдержки, генерации валидного JSON и формирования ответов клиентам по регламенту компании.

Параметры и гиперпараметры

  • —Базовая модель: Qwen/Qwen2.5-3B-Instruct (3.09B параметров)
  • —Обучаемые параметры (LoRA): ~14.8M (0.48% от весов модели)
  • —Метод: QLoRA (4-bit NF4)
  • —Конфигурация LoRA: r=16, alpha=32, dropout=0.05, target_modules: all-linear
  • —Эпохи и шаги: 3 эпохи, 450 шагов (effective batch size = 8)
  • —Оптимизатор: pagedadamw8bit, learning rate 2e-4, косинусный шедулер

Пайплайн данных

  1. 1.Синтез 1 600 диалогов поддержки с помощью Distilabel.
  2. 2.Дедупликация через MinHash LSH (text-dedup, Jaccard threshold 0.85).
  3. 3.Разбиение: Train (1 200), Eval (200), Test (100).

Метрики

  • —Train Loss: 1.82 -> 0.41
  • —Validation Loss: 1.88 -> 0.49
  • —JSON Schema Accuracy: 68% (base) -> 98.5% (tuned)
  • —Classification F1-score: 0.74 -> 0.93