markankamaransheogarat/qwen2.5-3b-supportops-lora
022
SupportOps-Qwen2.5-3B-LoRA
LoRA-адаптер для модели Qwen/Qwen2.5-3B-Instruct, дообученный на задаче классификации инцидентов техподдержки, генерации валидного JSON и формирования ответов клиентам по регламенту компании.
Параметры и гиперпараметры
- Базовая модель: Qwen/Qwen2.5-3B-Instruct (3.09B параметров)
- Обучаемые параметры (LoRA): ~14.8M (0.48% от весов модели)
- Метод: QLoRA (4-bit NF4)
- Конфигурация LoRA: r=16, alpha=32, dropout=0.05, target_modules: all-linear
- Эпохи и шаги: 3 эпохи, 450 шагов (effective batch size = 8)
- Оптимизатор: pagedadamw8bit, learning rate 2e-4, косинусный шедулер
Пайплайн данных
- Синтез 1 600 диалогов поддержки с помощью Distilabel.
- Дедупликация через MinHash LSH (
text-dedup, Jaccard threshold 0.85). - Разбиение: Train (1 200), Eval (200), Test (100).
Метрики
- Train Loss: 1.82 -> 0.41
- Validation Loss: 1.88 -> 0.49
- JSON Schema Accuracy: 68% (base) -> 98.5% (tuned)
- Classification F1-score: 0.74 -> 0.93
