ru-dataset/tg-ru-group-chats
💬 Telegram RU Group Chats Русскоязычный датасет диалогов из Telegram-групп технической тематики. Dataset Summary Язык Русский Записей 948 063 Уникальных участников 14 065 Реплаев 533 624 (56.3%) Период 2015 — 2026 Тематика Программирование, технологии Dataset Structure Fields Поле Тип Описание id int ID сообщения date string Дата (ISO 8601) date_ts int Unix timestamp type string Тип… See the full description on the dataset page: https://huggingface.co/datasets/ru-dataset/tg-ru-group-chats.
💬 Telegram RU Group Chats
Русскоязычный датасет диалогов из Telegram-групп технической тематики.
Dataset Summary
Dataset Structure
Fields
Example
{
"id": 2315269,
"date": "2024-05-13T06:55:36+00:00",
"type": "text",
"text": "Как настроить nginx в контейнере?",
"sender": {
"id": 123456789,
"alias": "user_1",
"is_bot": false
},
"is_reply": true,
"reply_to": {
"reply_to_msg_id": 2315260,
"reply_to_peer_id": "None",
"forum_topic": false,
"reply_to_top_id": null
},
"reactions": [{"emoji": "👍", "count": 3}],
"reactions_total": 3,
"has_media": false,
"has_links": false
}Usage
from datasets import load_dataset
ds = load_dataset("ru-dataset/tg-ru-group-chats")
print(ds["train"][0])Фильтрация только текстовых сообщений:
text_only = ds["train"].filter(lambda x: x["text"] and not x["has_media"])Восстановление диалоговых цепочек:
import pandas as pd
df = ds["train"].to_pandas()
replies = df[df["reply_to"].apply(
lambda x: x.get("reply_to_msg_id") == 2315260 if x else False
)]Intended Use
- Fine-tuning русскоязычных диалоговых моделей
- Моделирование диалогов — 56% сообщений являются ответами, цепочки восстанавливаются через
reply_to - Классификация тематики и стиля общения
- Анализ технических русскоязычных сообществ
License
Apache-2.0 — можно использовать, модифицировать и распространять в том числе в коммерческих целях.
