CoolFace
Datasetpublic

DaniilMako/even-russian-instructions

Even Russian Instructions Инструкционный датасет для fine-tuning VLM-моделей (Qwen3-VL) на эвенском языке — критически исчезающем тунгусо-маньчжурском языке Сибири.Примеры сгенерировано путем синтеза шаблонным методом на основе параллельного русско-эвенского корпуса. Структура датасета Три предварительно разделённых сплита для curriculum learning: Сплит Примеров Размер train 96 327 2.6 MB val 5 665 175 KB test 11 331 341 KB Поля… See the full description on the dataset page: https://huggingface.co/datasets/DaniilMako/even-russian-instructions.

sourceHugging Facecc-by-nc-4.0updated 2mo agoView on Hugging Face
0likes42downloads
Dataset Card

Even Russian Instructions

Инструкционный датасет для fine-tuning VLM-моделей (Qwen3-VL) на эвенском языке — критически исчезающем тунгусо-маньчжурском языке Сибири. Примеры сгенерировано путем синтеза шаблонным методом на основе параллельного русско-эвенского корпуса.

Структура датасета

Три предварительно разделённых сплита для curriculum learning:

СплитПримеровРазмер
train96 3272.6 MB
val5 665175 KB
test11 331341 KB

Поля

КолонкаТипОписание
systemstringСистемный промпт: «Ты — эксперт по эвенскому языку. Отвечай точно и кратко.»
user_messagestringВопрос пользователя (на русском или эвенском)
assistant_messagestringОжидаемый ответ (на эвенском или русском)
task_typeClassLabel17 типов задач (см. ниже)
stageint32Стадия curriculum: 1 (Vocab), 2 (Grammar), 3 (Comprehension)

Типы задач (17)

IDТипОписаниеСтадия
0category_vocabularyСлова по семантическим категориям1
1classificationКлассификация слов2
2domain_questionВопросы по доменам3
3fill_blankЗаполнение пропусков (склонение)2
4grammar_conjugationСпряжение глаголов2
5grammar_declensionСклонение существительных (13 падежей)2
6grammar_negationОтрицание (эс-/эч-/эт- парадигма)2
7grammar_ruleВопросы по грамматическим правилам2
8qa_grammarВопросы по грамматике1
9rc_question_wordsВопросительные слова (ӈи/илэ/ок/ӈитки)3
10reading_comprehensionПонимание текста (few-shot)3
11sentence_comprehensionПонимание предложений2
12tr_sentenceПеревод предложений (few-shot)3
13tr_vocabularyHeld-out лексика1
14translation_phraseПеревод фраз3
15translation_sentenceПеревод предложений2
16translation_wordПеревод слов1

Curriculum Learning

Датасет организован в 3 стадии возрастающей сложности:

  1. 1.Stage 1 — Vocab Foundation (~50K): перевод слов, категорийная лексика, вопросы по грамматике
  2. 2.Stage 2 — Grammar + CL (~20K): склонение, спряжение, отрицание, классификация, шаблонные предложения
  3. 3.Stage 3 — Comprehension (~43K): чтение с пониманием (few-shot), перевод предложений (few-shot), разговорник, вопросы по доменам, вопросительные слова

Использование

python
from datasets import load_dataset

ds = load_dataset("DaniilMako/even-russian-instructions")

# Доступ к сплитам
train = ds["train"]
val = ds["val"]
test = ds["test"]

# Фильтрация по типу задачи
translation = train.filter(lambda x: x["task_type"] == "translation_word")

# Curriculum learning: стадии по порядку
for stage in [1, 2, 3]:
    stage_data = train.filter(lambda x, s=stage: x["stage"] == s)
    print(f"Stage {stage}: {len(stage_data)} примеров")

Лицензия

CC-BY-NC-4.0 — только некоммерческое использование.