CoolFace
Datasetpublic

Arrtemwolf/medical-specialist-routing

Датасет для маршрутизации медицинских обращений Контекст задачи Данный датасет создан для обучения модели классификации текстов жалоб пациентов по медицинским специализациям. Цель — автоматически определять, к какому врачу следует направить пациента на основе его описания симптомов. Создание датасета Реальные данные взяты из датасета blinoff/medical_qa_ru_data и очищены (удалены пустые значения, короткие/длинные тексты, проведена дедупликация).… See the full description on the dataset page: https://huggingface.co/datasets/Arrtemwolf/medical-specialist-routing.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
1likes21downloads
Dataset Card

Датасет для маршрутизации медицинских обращений

Контекст задачи

Данный датасет создан для обучения модели классификации текстов жалоб пациентов по медицинским специализациям. Цель — автоматически определять, к какому врачу следует направить пациента на основе его описания симптомов.

Создание датасета

  • —Реальные данные взяты из датасета blinoff/medical_qa_ru_data и очищены (удалены пустые значения, короткие/длинные тексты, проведена дедупликация).
  • —Синтетические данные сгенерированы с помощью LLM (Qwen2.5-1.5B-Instruct) методом Self-Instruct для покрытия редких классов и разнообразия формулировок.
  • —Итоговый датасет сбалансирован по классам (или близок к сбалансированному).

Распределение классов

label Гинеколог 241 Терапевт 153 Невролог 115 Гастроэнтеролог 91 Дерматолог 71 Уролог 61 Отоларинголог 57 Травматолог 51 Хирург 49 Офтальмолог 42 Стоматолог 37 Проктолог 35

Всего записей: 1003

Структура

  • —text: текст жалобы пациента (str)
  • —label: медицинская специализация (str)

Ограничения

  • —Датасет содержит синтетические данные, которые могут иметь артефакты генерации.
  • —Реальные данные взяты с форума, могут содержать неполные или нерелевантные описания.
  • —Размер датасета ограничен, для продакшн-систем рекомендуется увеличение выборки.

Использование

Датасет предназначен для дообучения (SFT) языковых моделей или для обучения классификаторов на основе эмбеддингов.