CoolFace
Datasetpublic

necrasov-ilya/zhiznmart-spam-classification

ZhiznMart Spam Classification Русскоязычный набор сообщений для бинарной классификации спама в Telegram. Данные сформированы на основе сообщений из одного из чатов филиала компании «Жизньмарт» и использовались при разработке систем модерации DespamLy Telegram Bot и LifeMart Safety. Состав Файл messages.csv содержит 5 648 строк и два поля: Поле Тип Описание message string Текст сообщения label int 0 — не спам, 1 — спам Распределение классов: 2 953… See the full description on the dataset page: https://huggingface.co/datasets/necrasov-ilya/zhiznmart-spam-classification.

sourceHugging Facecc-by-4.0updated 28d agoView on Hugging Face
0likes93downloads
Dataset Card

ZhiznMart Spam Classification

Русскоязычный набор сообщений для бинарной классификации спама в Telegram. Данные сформированы на основе сообщений из одного из чатов филиала компании «Жизньмарт» и использовались при разработке систем модерации DespamLy Telegram Bot и LifeMart Safety.

Состав

Файл messages.csv содержит 5 648 строк и два поля:

ПолеТипОписание
messagestringТекст сообщения
labelint0 — не спам, 1 — спам

Распределение классов: 2 953 строки класса 0 (52,3%) и 2 695 строк класса 1 (47,7%). В наборе 5 577 уникальных текстов и 71 точный дубликат (замены при анонимизации привели к совпадению части текстов, различавшихся до обезличивания только контактами). Текстов с конфликтующими метками не обнаружено.

[image]

Анонимизация

Публикуемая версия файла messages.csv обезличена: номера телефонов, e-mail, ссылки и домены, Telegram-хэндлы, имена (включая имёна-префиксы в логах чата) и адреса доставки заменены токенами <PHONE>, <EMAIL>, <URL>, <HANDLE>, <PERSON> и <ADDRESS> соответственно. Замена детерминированная: каждому исходному значению соответствует один токен, поэтому повторяемость контактов в сообщениях сохраняется. Торговые наименования (в т.ч. «Жизньмарт»), промокоды и номера заказов не изменялись. Метрики базовых моделей ниже посчитаны на выборке до анонимизации.

Базовые метрики

Метрики получены локальным воспроизводимым прогоном на стратифицированной отложенной выборке с random_state=42. Для DespamLy использованы символьный TF-IDF (char_wb, n-граммы 1–4, 10 000 признаков), логистическая регрессия и изотоническая калибровка. Для базового фильтра LifeMart Safety использованы словный TF-IDF и Multinomial Naive Bayes; модель обучалась только на обучающей части выборки.

РеализацияТестовая выборкаAccuracyPrecisionRecallF1ROC-AUC
DespamLy: TF-IDF + Logistic Regression1 1260,9900,9870,9930,9900,995
LifeMart Safety: TF-IDF + MultinomialNB1 6950,9560,9530,9560,9540,992

[image]

Репозиторий LifeMart Safety также содержит исследовательскую схему с multilingual-e5-small, прототипами кластеров и мета-классификатором Logistic Regression. Её опубликованные метрики не включены в таблицу: в репозитории отсутствуют необходимые модельные артефакты для независимого воспроизведения.

Ограничения

Выборка относится к одному чату и не отражает все филиалы, периоды и типы Telegram-сообществ. Случайное разбиение по строкам не проверяет переносимость между чатами или во времени. Перед использованием рекомендуется удалить дубликаты, провести отдельную проверку качества разметки и оценить модель на данных из целевой среды.

В сообщениях могут присутствовать пользовательские имена, ссылки, номера телефонов, персональные данные и коммерческая информация. Набор не предназначен для восстановления личности авторов сообщений, рассылок или иных действий вне задачи модерации.

Правовой статус

Права на исходные сообщения и содержащиеся в них материалы могут принадлежать их авторам и иным правообладателям. Публикатор не заявляет наличие исключительных прав на тексты сообщений и не несёт ответственности за нарушения авторских, смежных и иных прав при дальнейшем использовании набора. Пользователь самостоятельно определяет наличие правовых оснований для обработки и распространения данных в своей юрисдикции.