datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
kaggle-toxic-annotated-filteredfiltered_toxic_samplesrussian-toxic-filtered
Russian Toxic Filtered Dataset
Отфильтрованный и сбалансированный датасет для бинарной классификации токсичности текстов на русском языке.
Источник данных
Исходный датасет: Mnwa/russian-toxic
Обработка
Удаление пустых значений
Удаление дубликатов
Фильтрация по длине (< 3 слов или > 500 слов)
Undersampling для балансировки классов
Разделение train/val/test = 80/10/10
Размеры сплитов
Train: 83 507 строк
Val: 10 438 строк
Test: 10 439… See the full description on the dataset page: https://huggingface.co/datasets/dimkonn/russian-toxic-filtered.kinopotok-support-toxic-filter_2
Dataset Card for "kinopotok-support-toxic-filter_2"
Обзор датасета
Этот датасет предназначен для обучения и валидации моделей многотикеточной классификации (Multi-label Classification) токсичного русскоязычного контента. Данные размечены по трем независимым бизнес-категориям модерации.
Структура данных
Каждый объект датасета содержит очищенный текст комментария и три бинарные метки:
text (string): Очищенный текст комментария пользователя.
profanity… See the full description on the dataset page: https://huggingface.co/datasets/AlucardV/kinopotok-support-toxic-filter_2.kinopotok-support-toxic-filterfiltered-toxic-responsestoxic-full-filtered-polarity
