lenyamal/hftuning
0
📄 arXiv Paper Classifier
Классификатор научных статей по 121 категории arXiv на основе названия и аннотации.
🎯 Задача
Сервис принимает название статьи (обязательно) и абстракт (опционально) и предсказывает наиболее вероятную тематику статьи из таксономии arXiv. Результат выводится в формате top-95%: категории сортируются по убыванию вероятности, пока их суммарная вероятность не превысит 95%.
🤖 Модель
- Архитектура:
distilbert-base-cased— облегчённая версия BERT (66M параметров) - Подход: Полный fine-tune предобученной модели
- Голова: Классификационная голова поверх [CLS]-токена на 121 класс
- Оптимизация: AdamW, learning rate 2e-5, weight decay 0.01
- Регуляризация: Early stopping (patience=2)
📚 Обучение
- Аппаратное обеспечение: 2 × NVIDIA RTX 5060 Ti
- Время обучения: 1.5 часа
- Эпохи: 3 (с ранней остановкой)
- Batch size: 16 (на устройство)
- Длина последовательности: 512 токенов
- Mixed precision: FP16
📊 Данные
- Источник: TimSchopf/arxiv_categories
- Объём: 163k train / 20k validation / 20k test
- Категории: 121 уникальная категория arXiv
📈 Результаты на тестовой выборке
🚀 Как использовать
- Введите название статьи (обязательное поле)
- При желании добавьте абстракт — это повышает точность
- Нажмите Классифицировать и получите топ-95% наиболее вероятных категорий
🛠️ Технологии
- Backend: Python, PyTorch, Transformers
- Frontend: Streamlit
- Деплой: Hugging Face Spaces + Docker
🔗 Ссылки
Проект выполнен в рамках курса по машинному обучению
