toxic_filter
filtered_toxic_sampleskaggle-toxic-annotated-filteredrussian-toxic-filtered
Russian Toxic Filtered Dataset
Отфильтрованный и сбалансированный датасет для бинарной классификации токсичности текстов на русском языке.
Источник данных
Исходный датасет: Mnwa/russian-toxic
Обработка
Удаление пустых значений
Удаление дубликатов
Фильтрация по длине (< 3 слов или > 500 слов)
Undersampling для балансировки классов
Разделение train/val/test = 80/10/10
Размеры сплитов
Train: 83 507 строк
Val: 10 438 строк
Test: 10 439… See the full description on the dataset page: https://huggingface.co/datasets/dimkonn/russian-toxic-filtered.kinopotok-support-toxic-filter_2
Dataset Card for "kinopotok-support-toxic-filter_2"
Обзор датасета
Этот датасет предназначен для обучения и валидации моделей многотикеточной классификации (Multi-label Classification) токсичного русскоязычного контента. Данные размечены по трем независимым бизнес-категориям модерации.
Структура данных
Каждый объект датасета содержит очищенный текст комментария и три бинарные метки:
text (string): Очищенный текст комментария пользователя.
profanity… See the full description on the dataset page: https://huggingface.co/datasets/AlucardV/kinopotok-support-toxic-filter_2.kinopotok-support-toxic-filterfiltered-toxic-responses
