CoolFace
Datasetpublic

dimkonn/russian-toxic-filtered

Russian Toxic Filtered Dataset Отфильтрованный и сбалансированный датасет для бинарной классификации токсичности текстов на русском языке. Источник данных Исходный датасет: Mnwa/russian-toxic Обработка Удаление пустых значений Удаление дубликатов Фильтрация по длине (< 3 слов или > 500 слов) Undersampling для балансировки классов Разделение train/val/test = 80/10/10 Размеры сплитов Train: 83 507 строк Val: 10 438 строк Test: 10 439… See the full description on the dataset page: https://huggingface.co/datasets/dimkonn/russian-toxic-filtered.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes16downloads
Dataset Card

Russian Toxic Filtered Dataset

Отфильтрованный и сбалансированный датасет для бинарной классификации токсичности текстов на русском языке.

Источник данных

Исходный датасет: Mnwa/russian-toxic

Обработка

  1. 1.Удаление пустых значений
  2. 2.Удаление дубликатов
  3. 3.Фильтрация по длине (< 3 слов или > 500 слов)
  4. 4.Undersampling для балансировки классов
  5. 5.Разделение train/val/test = 80/10/10

Размеры сплитов

  • —Train: 83 507 строк
  • —Val: 10 438 строк
  • —Test: 10 439 строк

Формат

  • —text: строка — текст сообщения
  • —label: 0 — токсичный, 1 — нетоксичный

Использование

python
from datasets import load_dataset
dataset = load_dataset("dimkonn/russian-toxic-filtered")