NikolayRainWay/multitask-very-toxic-comments
⚠️ ВАЖНОЕ ПРЕДУПРЕЖДЕНИЕ (DISCLAIMER) ⚠️ Данный датасет создан исключительно в образовательных и исследовательских целях для разработки моделей машинного обучения в области классификации токсичности. 1. Источники данных Основная часть (159 562 записи) взята из открытого датасета Jigsaw Toxic Comment Classification Challenge (Kaggle). Эти тексты — на английском языке. Дополнительная часть (5 595 записей) сгенерирована с помощью LLM (Large Language Model)… See the full description on the dataset page: https://huggingface.co/datasets/NikolayRainWay/multitask-very-toxic-comments.
⚠️ ВАЖНОЕ ПРЕДУПРЕЖДЕНИЕ (DISCLAIMER) ⚠️
Данный датасет создан исключительно в образовательных и исследовательских целях для разработки моделей машинного обучения в области классификации токсичности.
1. Источники данных
- Основная часть (159 562 записи) взята из открытого датасета Jigsaw Toxic Comment Classification Challenge (Kaggle). Эти тексты — на английском языке.
- Дополнительная часть (5 595 записей) сгенерирована с помощью LLM (Large Language Model) специально для балансировки редких классов (
threatиillegal). Эти тексты — на русском языке.
Таким образом, датасет является смешанным (английский + русский).
2. Содержание и этические ограничения
Датасет содержит реальные и синтетические тексты, которые могут включать:
- Нецензурную лексику, оскорбления и унизительные выражения.
- Угрозы физической расправы, насилия и запугивания.
- Крайне жестокие, аморальные и неприемлемые запросы, связанные с нарушением закона (например, изготовление оружия, наркотиков, террористические действия).
Важно: такие примеры добавлены исключительно для обучения модели распознаванию опасного контента, чтобы в дальнейшем автоматически фильтровать его в социальных сетях и защищать пользователей.
3. Ограничения использования
- Данный датасет не предназначен для пропаганды, распространения или совершения каких-либо незаконных или аморальных действий.
- Использование датасета разрешено только в рамках научно-исследовательских и образовательных проектов по обработке естественного языка (NLP).
- Автор датасета не несёт ответственности за любое нецелевое использование данных.
4. Особенности класса illegal
В большинстве открытых датасетов отсутствует прямая разметка для класса illegal (запросы на нарушение закона). В связи с этим:
- В основном датасете (Jigsaw) класс
illegalбыл создан как прокси-метка на основе объединения колонокsevere_toxicиthreat(логическое ИЛИ). - Дополнительно были сгенерированы синтетические примеры на русском языке, которые могут быть особенно жестокими и шокирующими. Это сделано намеренно, чтобы модель научилась распознавать даже самые крайние формы опасного контента.
5. Рекомендация
При работе с датасетом рекомендуется проявлять психологическую осторожность — некоторые формулировки могут вызвать сильный эмоциональный дискомфорт.
📊 Структура датасета
Колонки
- text (string): текст комментария (на английском или русском языке)
- profanity (int): 1 — есть ненормативная лексика/мат, 0 — нет
- threat (int): 1 — есть угроза, 0 — нет
- illegal (int): 1 — есть запрос на нарушение закона, 0 — нет
Примечание: колонка __index_level_0__ является служебной и может быть проигнорирована.
Размер
- Всего записей: 165 157
- Формат хранения: JSON Lines (
.jsonl)
Распределение классов
Пересечение классов
- Из всех угроз (1 410) с матом (
profanity) пересекаются 606 (43.0%). Это означает, что угрозы часто, но не всегда, сопровождаются нецензурной лексикой.
📂 Источники данных
- Основной датасет: Jigsaw Toxic Comment Classification Challenge (лицензия: CC0)
- Синтетические данные: 5 595 примеров, сгенерированных с помощью LLM специально для этого датасета (русскоязычные, с фокусом на редкие классы).
🚀 Пример использования
from datasets import load_dataset
dataset = load_dataset("NikolayRainWay/multitask-very-toxic-comments")
print(dataset['train'][0])
⚠️ Ограничения
Класс illegal является прокси-меткой (не прямая разметка) для основной части данных; синтетические примеры имеют прямую разметку.
Датасет содержит тексты на двух языках: английском и русском.
Наблюдается сильный дисбаланс классов — рекомендуется использовать взвешенную функцию потерь при обучении (например, BCEWithLogitsLoss с pos_weight).
---
### Что именно обновлено по сравнению с предыдущей версией:
| Раздел | Было | Стало |
|--------|------|-------|
| Общее количество записей | 160 529 | **165 157** |
| Количество синтетических примеров | ~1 500 | **5 595** |
| Распределение profanity | ~9 340 (5.82%) | **9 447 (5.72%)** |
| Распределение threat | ~931 (0.58%) | **1 410 (0.85%)** |
| Распределение illegal | ~2 809 (1.75%) | **3 568 (2.16%)** |
| Пересечение угроз с матом | (не было) | **43.0%** (606 из 1410) |
| dataset_info (размер, байты) | 66 465 196 байт | **68 633 700 байт** (примерно) |
| Языки | en, ru | (осталось) |
| Дисклеймер | Упоминание о синтетике без деталей | Уточнено количество и цель генерации |
