cepere/25k-gold-from-10m-user-chats
25k Gold from 10M User Chats Высококачественный датасет для дообучения (SFT) на русском языке, содержащий 25 836 строк реальных пользовательских запросов с развёрнутыми ответами. Владелец: Команда ОЗАРНИК Что это Это набор настоящих вопросов от пользователей, которые задавали их Claude Opus 4.7, после чего каждый ответ и запрос фильтровался моделью GPT-5.5 от мусора и низкокачественного контента. Абсолютно каждый вопрос прошёл сложный пайплайн оценки. Было… See the full description on the dataset page: https://huggingface.co/datasets/cepere/25k-gold-from-10m-user-chats.
25k Gold from 10M User Chats
Высококачественный датасет для дообучения (SFT) на русском языке, содержащий 25 836 строк реальных пользовательских запросов с развёрнутыми ответами.
Владелец: Команда ОЗАРНИК
Что это
Это набор настоящих вопросов от пользователей, которые задавали их Claude Opus 4.7, после чего каждый ответ и запрос фильтровался моделью GPT-5.5 от мусора и низкокачественного контента.
Абсолютно каждый вопрос прошёл сложный пайплайн оценки. Было обработано более 10 миллионов пользовательских сообщений в различных сервисах. В этом конкретном датасете отобраны технические и рабочие задачи.
Состав
- Язык: русский
- Размер: 25 836 примеров
- Формат: JSONL, формат чата (
messagesс ролямиuser/assistant) - Тематика: технические и рабочие задачи (программирование, наука, инженерия, аналитика и т.п.)
Формат данных
Каждая строка — отдельный JSON-объект:
{
"messages": [
{"role": "user", "content": "..."},
{"role": "assistant", "content": "..."}
]
}Пайплайн отбора
- Сбор реальных пользовательских сообщений из различных сервисов (>10 млн сообщений).
- Получение ответов от Claude Opus 4.7.
- Фильтрация и оценка качества с помощью GPT-5.5 — отсев мусора и нерелевантного контента.
- Отбор технических и рабочих задач.
Загрузка
from datasets import load_dataset
ds = load_dataset("json", data_files="train.jsonl", split="train")
print(ds[0])Примечание
Побочные датасеты (например, связанные с цензурой и другими категориями) пока не публикуются — они хранятся отдельно и будут выложены не скоро.
