DaniilMako/even-russian-instructions
Even Russian Instructions Инструкционный датасет для fine-tuning VLM-моделей (Qwen3-VL) на эвенском языке — критически исчезающем тунгусо-маньчжурском языке Сибири.Примеры сгенерировано путем синтеза шаблонным методом на основе параллельного русско-эвенского корпуса. Структура датасета Три предварительно разделённых сплита для curriculum learning: Сплит Примеров Размер train 96 327 2.6 MB val 5 665 175 KB test 11 331 341 KB Поля… See the full description on the dataset page: https://huggingface.co/datasets/DaniilMako/even-russian-instructions.
Even Russian Instructions
Инструкционный датасет для fine-tuning VLM-моделей (Qwen3-VL) на эвенском языке — критически исчезающем тунгусо-маньчжурском языке Сибири. Примеры сгенерировано путем синтеза шаблонным методом на основе параллельного русско-эвенского корпуса.
Структура датасета
Три предварительно разделённых сплита для curriculum learning:
Поля
Типы задач (17)
Curriculum Learning
Датасет организован в 3 стадии возрастающей сложности:
- Stage 1 — Vocab Foundation (~50K): перевод слов, категорийная лексика, вопросы по грамматике
- Stage 2 — Grammar + CL (~20K): склонение, спряжение, отрицание, классификация, шаблонные предложения
- Stage 3 — Comprehension (~43K): чтение с пониманием (few-shot), перевод предложений (few-shot), разговорник, вопросы по доменам, вопросительные слова
Использование
from datasets import load_dataset
ds = load_dataset("DaniilMako/even-russian-instructions")
# Доступ к сплитам
train = ds["train"]
val = ds["val"]
test = ds["test"]
# Фильтрация по типу задачи
translation = train.filter(lambda x: x["task_type"] == "translation_word")
# Curriculum learning: стадии по порядку
for stage in [1, 2, 3]:
stage_data = train.filter(lambda x, s=stage: x["stage"] == s)
print(f"Stage {stage}: {len(stage_data)} примеров")Лицензия
CC-BY-NC-4.0 — только некоммерческое использование.
