dimkonn/russian-toxic-filtered
Russian Toxic Filtered Dataset Отфильтрованный и сбалансированный датасет для бинарной классификации токсичности текстов на русском языке. Источник данных Исходный датасет: Mnwa/russian-toxic Обработка Удаление пустых значений Удаление дубликатов Фильтрация по длине (< 3 слов или > 500 слов) Undersampling для балансировки классов Разделение train/val/test = 80/10/10 Размеры сплитов Train: 83 507 строк Val: 10 438 строк Test: 10 439… See the full description on the dataset page: https://huggingface.co/datasets/dimkonn/russian-toxic-filtered.
Russian Toxic Filtered Dataset
Отфильтрованный и сбалансированный датасет для бинарной классификации токсичности текстов на русском языке.
Источник данных
Исходный датасет: Mnwa/russian-toxic
Обработка
- Удаление пустых значений
- Удаление дубликатов
- Фильтрация по длине (< 3 слов или > 500 слов)
- Undersampling для балансировки классов
- Разделение train/val/test = 80/10/10
Размеры сплитов
- Train: 83 507 строк
- Val: 10 438 строк
- Test: 10 439 строк
Формат
text: строка — текст сообщенияlabel: 0 — токсичный, 1 — нетоксичный
Использование
from datasets import load_dataset
dataset = load_dataset("dimkonn/russian-toxic-filtered")
