CoolFace
Datasetpublic

ru-dataset/tg-ru-engagement

📨 Telegram Russian Posts — Engagement Dataset Коллекция русскоязычных постов из Telegram-каналов с метриками вовлечённости (просмотры, репосты). Датасет предназначен для задач fine-tuning языковых моделей, предсказания вирусности и классификации контента. Dataset Summary Язык Русский Записей 70 448 Период Октябрь 2021 — Июль 2026 Источник Telegram-каналы (парсинг) Средняя длина текста 274 символа Медиана просмотров 145 109 Макс.… See the full description on the dataset page: https://huggingface.co/datasets/ru-dataset/tg-ru-engagement.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
1likes47downloads
Dataset Card

📨 Telegram Russian Posts — Engagement Dataset

Коллекция русскоязычных постов из Telegram-каналов с метриками вовлечённости (просмотры, репосты). Датасет предназначен для задач fine-tuning языковых моделей, предсказания вирусности и классификации контента.

Dataset Summary

ЯзыкРусский
Записей70 448
ПериодОктябрь 2021 — Июль 2026
ИсточникTelegram-каналы (парсинг)
Средняя длина текста274 символа
Медиана просмотров145 109
Макс. просмотров6 933 562

Dataset Structure

Fields

ПолеТипОписание
idintID поста в канале
datestringДата публикации (ISO 8601)
textstringТекст поста
linkslistСписок ссылок в тексте
has_linksboolНаличие ссылок
has_mediaboolНаличие медиафайла
media_typestring/nullТип медиа: photo, video, document, other
viewsintКоличество просмотров
forwardsintКоличество репостов
reply_toint/nullID поста, на который является ответом

Example

json
{
  "id": 42952,
  "date": "2026-07-21T18:42:01+00:00",
  "text": "Новая версия Telegram перегревает iPhone и заваливает пользователей ложными уведомлениями...",
  "links": [],
  "has_links": false,
  "has_media": true,
  "media_type": "photo",
  "views": 44198,
  "forwards": 277,
  "reply_to": null
}

Usage

python
from datasets import load_dataset

ds = load_dataset("YOUR_USERNAME/tg-ru-engagement")
print(ds["train"][0])

Сортировка по вирусности:

python
df = ds["train"].to_pandas()
df.sort_values("views", ascending=False).head(10)

Фильтрация постов с медиа:

python
with_photo = ds["train"].filter(lambda x: x["media_type"] == "photo")

Intended Use

  • Fine-tuning русскоязычных языковых моделей
  • Предсказание вирусности по тексту (регрессия views/forwards)
  • Классификация стиля и жанра Telegram-контента
  • Анализ медиапотребления и трендов

Limitations

  • Датасет содержит рекламные посты без отдельной разметки
  • Ссылки внутри текста не раскрыты
  • Медиафайлы не включены, только метаданные о них