necrasov-ilya/zhiznmart-spam-classification
ZhiznMart Spam Classification Русскоязычный набор сообщений для бинарной классификации спама в Telegram. Данные сформированы на основе сообщений из одного из чатов филиала компании «Жизньмарт» и использовались при разработке систем модерации DespamLy Telegram Bot и LifeMart Safety. Состав Файл messages.csv содержит 5 648 строк и два поля: Поле Тип Описание message string Текст сообщения label int 0 — не спам, 1 — спам Распределение классов: 2 953… See the full description on the dataset page: https://huggingface.co/datasets/necrasov-ilya/zhiznmart-spam-classification.
ZhiznMart Spam Classification
Русскоязычный набор сообщений для бинарной классификации спама в Telegram. Данные сформированы на основе сообщений из одного из чатов филиала компании «Жизньмарт» и использовались при разработке систем модерации DespamLy Telegram Bot и LifeMart Safety.
Состав
Файл messages.csv содержит 5 648 строк и два поля:
Распределение классов: 2 953 строки класса 0 (52,3%) и 2 695 строк класса 1 (47,7%). В наборе 5 577 уникальных текстов и 71 точный дубликат (замены при анонимизации привели к совпадению части текстов, различавшихся до обезличивания только контактами). Текстов с конфликтующими метками не обнаружено.
Анонимизация
Публикуемая версия файла messages.csv обезличена: номера телефонов, e-mail, ссылки и домены, Telegram-хэндлы, имена (включая имёна-префиксы в логах чата) и адреса доставки заменены токенами <PHONE>, <EMAIL>, <URL>, <HANDLE>, <PERSON> и <ADDRESS> соответственно. Замена детерминированная: каждому исходному значению соответствует один токен, поэтому повторяемость контактов в сообщениях сохраняется. Торговые наименования (в т.ч. «Жизньмарт»), промокоды и номера заказов не изменялись. Метрики базовых моделей ниже посчитаны на выборке до анонимизации.
Базовые метрики
Метрики получены локальным воспроизводимым прогоном на стратифицированной отложенной выборке с random_state=42. Для DespamLy использованы символьный TF-IDF (char_wb, n-граммы 1–4, 10 000 признаков), логистическая регрессия и изотоническая калибровка. Для базового фильтра LifeMart Safety использованы словный TF-IDF и Multinomial Naive Bayes; модель обучалась только на обучающей части выборки.
Репозиторий LifeMart Safety также содержит исследовательскую схему с multilingual-e5-small, прототипами кластеров и мета-классификатором Logistic Regression. Её опубликованные метрики не включены в таблицу: в репозитории отсутствуют необходимые модельные артефакты для независимого воспроизведения.
Ограничения
Выборка относится к одному чату и не отражает все филиалы, периоды и типы Telegram-сообществ. Случайное разбиение по строкам не проверяет переносимость между чатами или во времени. Перед использованием рекомендуется удалить дубликаты, провести отдельную проверку качества разметки и оценить модель на данных из целевой среды.
В сообщениях могут присутствовать пользовательские имена, ссылки, номера телефонов, персональные данные и коммерческая информация. Набор не предназначен для восстановления личности авторов сообщений, рассылок или иных действий вне задачи модерации.
Правовой статус
Права на исходные сообщения и содержащиеся в них материалы могут принадлежать их авторам и иным правообладателям. Публикатор не заявляет наличие исключительных прав на тексты сообщений и не несёт ответственности за нарушения авторских, смежных и иных прав при дальнейшем использовании набора. Пользователь самостоятельно определяет наличие правовых оснований для обработки и распространения данных в своей юрисдикции.
