CoolFace
Datasetpublic

drkolesnikov/russian-nmo-medical-mcq

Russian NMO Medical MCQ Choose language / Выберите язык: Русский | English Русский Это датасет русскоязычных медицинских тестовых вопросов НМО с вариантами ответа. В нем есть вопросы с одним правильным вариантом и вопросы с несколькими правильными вариантами. Датасет подготовлен так, чтобы его можно было сразу использовать для тонкой настройки LLM, проверки качества ответов и экспериментов с медицинским QA. Главная идея простая: дать модели вопрос, тему и… See the full description on the dataset page: https://huggingface.co/datasets/drkolesnikov/russian-nmo-medical-mcq.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
2likes166downloads
Dataset Card

Russian NMO Medical MCQ

Choose language / Выберите язык: Русский | English

<a id="ru"></a>

Русский

Это датасет русскоязычных медицинских тестовых вопросов НМО с вариантами ответа. В нем есть вопросы с одним правильным вариантом и вопросы с несколькими правильными вариантами. Датасет подготовлен так, чтобы его можно было сразу использовать для тонкой настройки LLM, проверки качества ответов и экспериментов с медицинским QA.

Главная идея простая: дать модели вопрос, тему и варианты ответа, а на выходе получить номер правильного варианта или номера всех правильных вариантов.

Это образовательный датасет для тестов и экспериментов. Он не предназначен для клинической поддержки принятия решений.

Быстрый старт

python
from datasets import load_dataset

train = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_all", split="train")
example = train[0]
print(example["messages"])

Что внутри

  • —sft_all: основной вариант для fine-tuning; включает вопросы с одним и несколькими правильными ответами.
  • —sft_single: только вопросы с одним правильным ответом.
  • —sft_multi: только вопросы с несколькими правильными ответами.
  • —mcq: структурированный формат для анализа, фильтрации и оценки.

SFT-конфигурации уже содержат готовые поля messages, prompt и completion. Варианты ответа нумеруются с 0. Ответы также используют нумерацию с 0.

Пример ответа с одним правильным вариантом:

text
Ответ: 2. системный воспалительный ответ

Пример ответа с несколькими правильными вариантами:

text
Ответы: 0, 2, 4. лихорадка; тахикардия; лейкоцитоз

Для чего подходит

  • —fine-tuning русскоязычных LLM для медицинских тестовых вопросов;
  • —проверка качества ответов на single-choice и multiple-correct задания;
  • —построение учебных ассистентов и retrieval/evaluation пайплайнов;
  • —эксперименты с форматами медицинских MCQ.

<a id="en"></a>

English

This is a Russian-language medical NMO test dataset with multiple-choice answer options. It contains both single-correct questions and multiple-correct questions. The dataset is packaged for practical LLM fine-tuning, answer-quality evaluation, and medical QA experiments.

The core task is simple: given a topic, a question, and numbered answer choices, the model should return the number of the correct choice or the numbers of all correct choices.

This is an educational dataset for tests and experiments. It is not intended for clinical decision support.

Quick Start

python
from datasets import load_dataset

train = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_all", split="train")
example = train[0]
print(example["messages"])

What Is Included

  • —sft_all: the main fine-tuning view; includes both single-correct and multiple-correct questions.
  • —sft_single: only single-correct questions.
  • —sft_multi: only multiple-correct questions.
  • —mcq: structured canonical data for analysis, filtering, and evaluation.

The SFT configs already include messages, prompt, and completion fields. Answer choices are numbered from 0, and completions use the same zero-based numbering.

Single-correct completion example:

text
Ответ: 2. системный воспалительный ответ

Multiple-correct completion example:

text
Ответы: 0, 2, 4. лихорадка; тахикардия; лейкоцитоз

Good Uses

  • —fine-tuning Russian-language LLMs for medical test questions;
  • —evaluating single-choice and multiple-correct answer selection;
  • —building educational assistants and retrieval/evaluation pipelines;
  • —experimenting with medical MCQ formatting.

<details> <summary>More loading examples / Еще примеры загрузки</summary>

Load the structured MCQ view:

python
from datasets import load_dataset

mcq = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "mcq")

Load only single-correct or multiple-correct SFT rows:

python
single = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_single")
multi = load_dataset("drkolesnikov/russian-nmo-medical-mcq", "sft_multi")

Load a local export:

python
from datasets import load_dataset

mcq = load_dataset(".", "mcq")
sft_all = load_dataset(".", "sft_all")

</details>

<details> <summary>Technical schema / Техническая схема</summary>

Schema / Схема

mcq columns:

text
id
topic
question
choices
correct_choice_indices
correct_choice_texts
choice_count
correct_choice_count
is_multi_answer
task_type

SFT columns:

text
id
topic
task_type
correct_choice_indices
messages
prompt
completion

task_type is one of:

  • —single_choice
  • —multiple_correct

Answer indices are zero-based and preserve the original answer-choice order.

</details>

<details> <summary>Prompt and completion format / Формат промптов и ответов</summary>

Prompt Format / Формат промпта

SFT prompts include the topic when available, then the question and zero-based answer choices.

Example prompt:

text
Тема:
Геморрагический инсульт (по утвержденным клиническим рекомендациям) - 2025

Вопрос:
"Blend sign" ("признак смешения") – это

Варианты ответа:
0. мелкие отдельные очаги кровоизлияния вокруг основной гематомы
1. сочетание участков разной плотности в гематоме
2. экстравазация контрастного средства в виде точечных очагов внутри гематомы

SFT completions contain only selected answer number(s) and answer text, with no explanations.

Single-correct example:

text
Ответ: 2. системный воспалительный ответ

Multiple-correct example:

text
Ответы: 0, 2, 4. лихорадка; тахикардия; лейкоцитоз

</details>

<details> <summary>Splits, counts, and filters / Сплиты, размеры и фильтры</summary>

Splits / Сплиты

Splits are deterministic and grouped by normalized question ID:

  • —train: 90%
  • —validation: 5%
  • —test: 5%

All variants derived from the same normalized question stay in the same split.

Counts / Размеры

ConfigTrainValidationTestTotal
mcq384,28621,33221,342426,960
sft_single260,56114,54614,640289,747
sft_multi123,7256,7866,702137,213
sft_all384,28621,33221,342426,960

Excluded from all public configs:

  • —conflicting answer variants: 449
  • —answer sets attached to conflicting variants: 914
  • —answer sets with markdown/source-page artifacts: 4

</details>

<details> <summary>License / Лицензия</summary>

License

Released under cc-by-4.0.

Выпущено под лицензией cc-by-4.0.

</details>