CoolFace
Datasetpublic

AtesiT/ru-stem-dialogues

Russian STEM Educational Dialogues Описание Синтетический датасет русскоязычных учебных диалогов по STEM-темам (математика, физика, химия, биология, информатика, программирование, инженерия). Каждый диалог — реалистичное взаимодействие между пользователем (школьник / студент / профессионал) и ассистентом. Методология Модель: Qwen/Qwen2.5-7B-Instruct (4-bit NF4 quantization, bitsandbytes) Формат генерации: текстовый формат с разделителями… See the full description on the dataset page: https://huggingface.co/datasets/AtesiT/ru-stem-dialogues.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes28downloads
Dataset Card

Russian STEM Educational Dialogues

Описание

Синтетический датасет русскоязычных учебных диалогов по STEM-темам (математика, физика, химия, биология, информатика, программирование, инженерия). Каждый диалог — реалистичное взаимодействие между пользователем (школьник / студент / профессионал) и ассистентом.

Методология

  • Модель: Qwen/Qwen2.5-7B-Instruct (4-bit NF4 quantization, bitsandbytes)
  • Формат генерации: текстовый формат с разделителями <<<USER>>>/<<<ASSISTANT>>>
  • Валидация: структурная проверка чередования ролей + эвристика обрыва генерации + фильтр нерусских символов
  • Параметры: temperature=0.85, topp=0.9, maxnew_tokens=1300
  • Тем: 45 в 7 категориях

Структура записи

  • id — уникальный идентификатор
  • category, subcategory, topic — тематическая классификация
  • difficulty — уровень сложности
  • user_type — тип пользователя
  • question_format — формат вопроса
  • num_turns — количество пар "вопрос-ответ"
  • messages — список {"role": "user"/"assistant", "content": "..."}
  • generated_at — время генерации (UTC)

Статистика

МетрикаЗначение
Всего диалогов524
Среднее число сообщений4.62
Средняя длина (токены)668.9
Средняя длина (символы)2007.6
Type-Token Ratio (корпус)0.1022
Средний TTR на диалог0.5448
Прошли проверку качества89.1%

Распределение по категориям

КатегорияДиалогов
Математика135
Программирование79
Биология76
Физика70
Информатика62
Химия61
Инженерия41

Примеры

Тема: Электрические цепи и закон Ома | Сложность: начальный (школьный уровень) | Тип пользователя: студент бакалавриата

🧑 Пользователь: Имеется электрическая цепь с напряжением 12 В и сопротивлением 4 Ом. Я подсчитал, что ток должен быть равен 3 А. Правильно ли это?

🤖 Ассистент: Да, вы правильно рассчитали ток! Это действительно так. Используя закон Ома, который гласит, что ток (I) равен напряжению (U) деленному на сопротивление (R), вы получите: $I = \frac{U}{R} = \frac{12\, \text{В}}{4\, \Omega} = 3\, \text{А}$.

🧑 Пользователь: Но что если бы в цепи было больше сопротивлений, например, 6 Ом и 8 Ом параллельно? Как тогда рассчитать ток?

🤖 Ассистент: Хороший вопрос! В этом случае сопротивления будут параллельны, и общее сопротивление будет меньше, чем любое из них. Для параллельных сопротивлений общее сопротивление ($R{\text{общ}}$) рассчитывается по формуле: $\frac{1}{R{\text{общ}}} = \frac{1}{R1} + \frac{1}{R2}$. Если у нас $R1 = 6\, \Omega$ и $R2 = 8\, \Omega$, то: $\frac{1}{R_{\text{общ}}} = \frac{1}{6} + \frac{1}{8} = \frac{4 + 3}{2...


Тема: Списки, деревья, графы, хеш-таблицы | Сложность: продвинутый (студент магистратуры/аспирант) | Тип пользователя: самоучка-энтузиаст

🧑 Пользователь: Что такое дерево поиска и как оно используется в алгоритмах поиска в глубину? Я понимаю, что это структура данных, но мне нужна более подробная информация.

🤖 Ассистент: Дерево поиска — это структура данных, которая представляет собой граф без циклов, где каждый узел имеет один родитель, кроме корня, который не имеет родителей. В контексте алгоритмов поиска в глубину (DFS), дерево поиска используется для эффективного отслеживания пути по графу.

Представьте себе, что вы выполняете алгоритм DFS на графе, который представляет собой связанный список городов и дорог м...

🧑 Пользователь: Мне понравилось ваше объяснение. Но можно ли использовать дерево поиска в других алгоритмах, например в алгоритме поиска в ширину (BFS)?

🤖 Ассистент: Да, дерево поиска также используется в алгоритме поиска в ширину (BFS), хотя его роль немного отличается. В BFS дерево поиска помогает отслеживать все возможные пути до каждой вершины и позволяет оптимально выбирать следующую вершину для посещения на основе минимальной глубины или расстояния.

Когда вы выполняете BFS, вы начинаете с корневой вершины и продолжаете расширять ее уровень за уровнем. Д...


Использование

python
from datasets import load_dataset

ds = load_dataset("AtesiT/ru-stem-dialogues", split="train")
print(ds[0]["messages"])

Ограничения

  • Датасет синтетический — возможны фактические неточности в сложных темах
  • Рекомендуется дополнительная проверка перед использованием в продакшене

Лицензия

Apache 2.0