drkolesnikov/russian-nmo-medical-mcq
Russian NMO Medical MCQ Choose language / Выберите язык: Русский | English Русский Это датасет русскоязычных медицинских тестовых вопросов НМО с вариантами ответа. В нем есть вопросы с одним правильным вариантом и вопросы с несколькими правильными вариантами. Датасет подготовлен так, чтобы его можно было сразу использовать для тонкой настройки LLM, проверки качества ответов и экспериментов с медицинским QA. Главная идея простая: дать модели вопрос, тему и… See the full description on the dataset page: https://huggingface.co/datasets/drkolesnikov/russian-nmo-medical-mcq.
Russian NMO Medical MCQ
Choose language / Выберите язык: Русский | English
<a id="ru"></a>
Русский
Это датасет русскоязычных медицинских тестовых вопросов НМО с вариантами ответа. В нем есть вопросы с одним правильным вариантом и вопросы с несколькими правильными вариантами. Датасет подготовлен так, чтобы его можно было сразу использовать для тонкой настройки LLM, проверки качества ответов и экспериментов с медицинским QA.
Главная идея простая: дать модели вопрос, тему и варианты ответа, а на выходе получить номер правильного варианта или номера всех правильных вариантов.
Это образовательный датасет для тестов и экспериментов. Он не предназначен для клинической поддержки принятия решений.
Быстрый старт
from datasets import load_dataset
train = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_all", split="train")
example = train[0]
print(example["messages"])Что внутри
sft_all: основной вариант для fine-tuning; включает вопросы с одним и несколькими правильными ответами.sft_single: только вопросы с одним правильным ответом.sft_multi: только вопросы с несколькими правильными ответами.mcq: структурированный формат для анализа, фильтрации и оценки.
SFT-конфигурации уже содержат готовые поля messages, prompt и completion. Варианты ответа нумеруются с 0. Ответы также используют нумерацию с 0.
Пример ответа с одним правильным вариантом:
Ответ: 2. системный воспалительный ответПример ответа с несколькими правильными вариантами:
Ответы: 0, 2, 4. лихорадка; тахикардия; лейкоцитозДля чего подходит
- fine-tuning русскоязычных LLM для медицинских тестовых вопросов;
- проверка качества ответов на single-choice и multiple-correct задания;
- построение учебных ассистентов и retrieval/evaluation пайплайнов;
- эксперименты с форматами медицинских MCQ.
<a id="en"></a>
English
This is a Russian-language medical NMO test dataset with multiple-choice answer options. It contains both single-correct questions and multiple-correct questions. The dataset is packaged for practical LLM fine-tuning, answer-quality evaluation, and medical QA experiments.
The core task is simple: given a topic, a question, and numbered answer choices, the model should return the number of the correct choice or the numbers of all correct choices.
This is an educational dataset for tests and experiments. It is not intended for clinical decision support.
Quick Start
from datasets import load_dataset
train = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_all", split="train")
example = train[0]
print(example["messages"])What Is Included
sft_all: the main fine-tuning view; includes both single-correct and multiple-correct questions.sft_single: only single-correct questions.sft_multi: only multiple-correct questions.mcq: structured canonical data for analysis, filtering, and evaluation.
The SFT configs already include messages, prompt, and completion fields. Answer choices are numbered from 0, and completions use the same zero-based numbering.
Single-correct completion example:
Ответ: 2. системный воспалительный ответMultiple-correct completion example:
Ответы: 0, 2, 4. лихорадка; тахикардия; лейкоцитозGood Uses
- fine-tuning Russian-language LLMs for medical test questions;
- evaluating single-choice and multiple-correct answer selection;
- building educational assistants and retrieval/evaluation pipelines;
- experimenting with medical MCQ formatting.
<details> <summary>More loading examples / Еще примеры загрузки</summary>
Load the structured MCQ view:
from datasets import load_dataset
mcq = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "mcq")Load only single-correct or multiple-correct SFT rows:
single = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_single")
multi = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_multi")Load a local export:
from datasets import load_dataset
mcq = load_dataset(".", "mcq")
sft_all = load_dataset(".", "sft_all")</details>
<details> <summary>Technical schema / Техническая схема</summary>
Schema / Схема
mcq columns:
id
topic
question
choices
correct_choice_indices
correct_choice_texts
choice_count
correct_choice_count
is_multi_answer
task_typeSFT columns:
id
topic
task_type
correct_choice_indices
messages
prompt
completiontask_type is one of:
single_choicemultiple_correct
Answer indices are zero-based and preserve the original answer-choice order.
</details>
<details> <summary>Prompt and completion format / Формат промптов и ответов</summary>
Prompt Format / Формат промпта
SFT prompts include the topic when available, then the question and zero-based answer choices.
Example prompt:
Тема:
Геморрагический инсульт (по утвержденным клиническим рекомендациям) - 2025
Вопрос:
"Blend sign" ("признак смешения") – это
Варианты ответа:
0. мелкие отдельные очаги кровоизлияния вокруг основной гематомы
1. сочетание участков разной плотности в гематоме
2. экстравазация контрастного средства в виде точечных очагов внутри гематомыSFT completions contain only selected answer number(s) and answer text, with no explanations.
Single-correct example:
Ответ: 2. системный воспалительный ответMultiple-correct example:
Ответы: 0, 2, 4. лихорадка; тахикардия; лейкоцитоз</details>
<details> <summary>Splits, counts, and filters / Сплиты, размеры и фильтры</summary>
Splits / Сплиты
Splits are deterministic and grouped by normalized question ID:
- train: 90%
- validation: 5%
- test: 5%
All variants derived from the same normalized question stay in the same split.
Counts / Размеры
Excluded from all public configs:
- conflicting answer variants: 449
- answer sets attached to conflicting variants: 914
- answer sets with markdown/source-page artifacts: 4
</details>
<details> <summary>License / Лицензия</summary>
License
Released under cc-by-4.0.
Выпущено под лицензией cc-by-4.0.
</details>
