melsmm/spell-correction-ru
Spell Correction RU — датасеты для коррекции ошибок в русском тексте Набор данных для обучения моделей исправления орфографических, пунктуационных и регистровых ошибок в русскоязычных текстах. Каждый пример — пара «правильный текст» → «текст с ошибкой». Датасет использовался для обучения модели melsmm/Spell-Corrector-RU-4B. 📦 Код генерации, ноутбуки и полное описание проекта: github.com/melsmm/llm-spell-corrector Состав Датасет содержит две конфигурации… See the full description on the dataset page: https://huggingface.co/datasets/melsmm/spell-correction-ru.
Spell Correction RU — датасеты для коррекции ошибок в русском тексте
Набор данных для обучения моделей исправления орфографических, пунктуационных и регистровых ошибок в русскоязычных текстах.
Каждый пример — пара «правильный текст» → «текст с ошибкой». Датасет использовался для обучения модели `melsmm/Spell-Corrector-RU-4B`.
📦 Код генерации, ноутбуки и полное описание проекта: github.com/melsmm/llm-spell-corrector
Состав
Датасет содержит две конфигурации (сабсета):
Структура данных
Оба файла имеют одинаковые колонки:
Пример строки:
text: Об этом сообщает корреспондент «Ленты.ру».
text_corrupt: об этом сообщаеп корреспондент лертыру.
source: mixed_raw
method: mixed_lower_char_punctКак создавался
synth_1m — синтетический датасет (~1 млн)
Чистые тексты из корпусов nerus, gazeta, wikipedia портились набором алгоритмов: статистическим (SAGE: SBSC, CharAug, WordAug) и собственным алгоритмом внесения пунктуационных ошибок. Часть примеров оставлена без изменений (identity), чтобы модель не «переисправляла» корректный текст.
ready_30k — готовые пары (~30 тыс.)
Объединение реальных пар «ошибка → исправление» из открытых датасетов:
Загрузка
from datasets import load_dataset
# Синтетический датасет (~1 млн)
synth = load_dataset("melsmm/spell-correction-ru", "synth_1m", split="train")
# Готовые пары (~30 тыс.)
ready = load_dataset("melsmm/spell-correction-ru", "ready_30k", split="train")
print(synth[0])
# {'text': '...', 'text_corrupt': '...', 'source': '...', 'method': '...'}Назначение и применение
- Обучение моделей spell / punctuation correction для русского языка.
- Двухстадийное обучение: сначала на большом синтетическом наборе (
synth_1m), затем дообучение на качественных готовых парах (ready_30k). - Аугментация данных для GEC-задач.
Подача в модель: text_corrupt как вход, text как целевой ответ.
Источники и лицензии
Датасет собран на основе открытых корпусов и датасетов:
- nerus (новости Lenta.ru)
- IlyaGusev/gazeta
- misterkirill/ru-wikipedia
- RUSpellRU, MultidomainGold (через SAGE)
- russian_gec_dataset
При использовании учитывайте лицензии исходных корпусов.
Ограничения
- Большая часть
synth_1m— синтетические ошибки; их распределение может отличаться от реальных опечаток пользователей. - Тексты в основном из новостного, энциклопедического и общего доменов; узкоспециализированные домены (например, медицина) представлены слабо.
Ссылки
- 🔗 Проект на GitHub: https://github.com/melsmm/llm-spell-corrector
- 🤖 Обученная модель: https://huggingface.co/melsmm/Spell-Corrector-RU-4B
