grafnatt/russian-medical-complaints-dataset
Russian Medical Complaints Dataset 1. Описание задачи Данный датасет предназначен для обучения и оценки моделей классификации текстов и маршрутизации медицинских обращений пациентов на русском языке. Основная цель — автоматическое определение узкой врачебной специализации (10 основных классов) по описанию жалобы и симптоматики пациента. 2. Описание процесса генерации и сборки Датасет сформирован в рамках гибридной схемы разметки и синтеза данных:… See the full description on the dataset page: https://huggingface.co/datasets/grafnatt/russian-medical-complaints-dataset.
Russian Medical Complaints Dataset
1. Описание задачи
Данный датасет предназначен для обучения и оценки моделей классификации текстов и маршрутизации медицинских обращений пациентов на русском языке. Основная цель — автоматическое определение узкой врачебной специализации (10 основных классов) по описанию жалобы и симптоматики пациента.
2. Описание процесса генерации и сборки
Датасет сформирован в рамках гибридной схемы разметки и синтеза данных:
- Базовый источник: Агрегированные медицинские жалобы на русском языке.
- Аннотация и сэмплирование: Для разметки и оценки уверенности использовались LLM-подходы Zero-Shot и Few-Shot с применением подходов Self-Consistency (сэмплирование ответов при $T=0.8$).
- Фильтрация и контрольный анализ: Примеры с высокой вероятностью неопределенности или ошибок маршрутизации проходили процесс эмуляции ручной экспертной проверки (Human-in-the-loop).
3. Численные показатели
- Общий объем: >= 1000 записей.
- Структура полей:
desc(string) — текст жалобы или обращения пациента.spec10(string) — медицинская специализация (целевой класс).confidence(float) — показатель уверенности аннотации ($0.2 - 1.0$).
4. Визуализация распределения классов
На рисунке ниже представлено распределение целевых врачебных специализаций в датасете:
