CoolFace
Datasetpublic

Doji070/Toxic_dataset

Russian Multi-label Toxic Comments Dataset Описание датасета Датасет для мульти-лейбл классификации токсичных комментариев на русском языке. Каждый текст размечен по трем категориям: Profanity (ненормативная лексика) - наличие нецензурной лексики Threat (угрозы) - содержание угроз в адрес других пользователей Illegal (незаконные запросы) - запросы на нарушение закона (например, создание оружия, наркотиков) Структура данных Датасет содержит три… See the full description on the dataset page: https://huggingface.co/datasets/Doji070/Toxic_dataset.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
1likes59downloads
Dataset Card

Russian Multi-label Toxic Comments Dataset

Описание датасета

Датасет для мульти-лейбл классификации токсичных комментариев на русском языке. Каждый текст размечен по трем категориям:

  1. 1.Profanity (ненормативная лексика) - наличие нецензурной лексики
  2. 2.Threat (угрозы) - содержание угроз в адрес других пользователей
  3. 3.Illegal (незаконные запросы) - запросы на нарушение закона (например, создание оружия, наркотиков)

Структура данных

Датасет содержит три разделения:

  • Train: 9908 примеров (70%%)
  • Validation: 2123 примера (15%%)
  • Test: 2124 примера (15%%)

Каждый пример содержит:

  • cleaned_text: очищенный текст комментария
  • profanity: бинарная метка (0/1)
  • threat: бинарная метка (0/1)
  • illegal: бинарная метка (0/1)

Статистика

Распределение классов

КлассПоложительныеОтрицательныеСоотношение
Profanity4,726 (33.4%%)9,429 (66.6%%)1:2.0
Threat547 (3.9%%)13,608 (96.1%%)1:24.9
Illegal523 (3.7%%)13,632 (96.3%%)1:26.1

Корреляция между классами

  • Profanity-Threat: 0.018
  • Profanity-Illegal: -0.000
  • Threat-Illegal: 0.085

Источник данных

Базовый датасет взят с Kaggle: Russian Language Toxic Comments

Дополнительные метки (threat и illegal) были сгенерированы с использованием ключевых слов и паттернов.

Предобработка

  • Удаление ссылок, HTML-тегов и эмодзи
  • Приведение к нижнему регистру
  • Удаление дубликатов
  • Удаление слишком коротких текстов (менее 3 символов)

Примеры

Безопасный текст

"в шапке были ссылки на инфу по текущему фильму марвел"

Profanity

"верблюдов то за что? дебилы, бл."

Threat

"собаке собачья смерть"

Illegal

"хорош врать, ты террорист торч к шизофреник"

Использование

python
from datasets import load_dataset

dataset = load_dataset("ваш-username/russian-toxic-comments-multilabel")

Цель создания

Датасет создан для задачи мульти-лейбл классификации токсичных комментариев. Может использоваться для:

  • Модерации контента в социальных сетях
  • Автоматической фильтрации угроз
  • Детекции нецензурной лексики
  • Обучения моделей для безопасного общения

Лицензия

MIT License