CoolFace
Datasetpublic

cepere/25k-gold-from-10m-user-chats

25k Gold from 10M User Chats Высококачественный датасет для дообучения (SFT) на русском языке, содержащий 25 836 строк реальных пользовательских запросов с развёрнутыми ответами. Владелец: Команда ОЗАРНИК Что это Это набор настоящих вопросов от пользователей, которые задавали их Claude Opus 4.7, после чего каждый ответ и запрос фильтровался моделью GPT-5.5 от мусора и низкокачественного контента. Абсолютно каждый вопрос прошёл сложный пайплайн оценки. Было… See the full description on the dataset page: https://huggingface.co/datasets/cepere/25k-gold-from-10m-user-chats.

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes3downloads
Dataset Card

25k Gold from 10M User Chats

Высококачественный датасет для дообучения (SFT) на русском языке, содержащий 25 836 строк реальных пользовательских запросов с развёрнутыми ответами.

Владелец: Команда ОЗАРНИК

Что это

Это набор настоящих вопросов от пользователей, которые задавали их Claude Opus 4.7, после чего каждый ответ и запрос фильтровался моделью GPT-5.5 от мусора и низкокачественного контента.

Абсолютно каждый вопрос прошёл сложный пайплайн оценки. Было обработано более 10 миллионов пользовательских сообщений в различных сервисах. В этом конкретном датасете отобраны технические и рабочие задачи.

Состав

  • —Язык: русский
  • —Размер: 25 836 примеров
  • —Формат: JSONL, формат чата (messages с ролями user / assistant)
  • —Тематика: технические и рабочие задачи (программирование, наука, инженерия, аналитика и т.п.)

Формат данных

Каждая строка — отдельный JSON-объект:

json
{
  "messages": [
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ]
}

Пайплайн отбора

  1. 1.Сбор реальных пользовательских сообщений из различных сервисов (>10 млн сообщений).
  2. 2.Получение ответов от Claude Opus 4.7.
  3. 3.Фильтрация и оценка качества с помощью GPT-5.5 — отсев мусора и нерелевантного контента.
  4. 4.Отбор технических и рабочих задач.

Загрузка

python
from datasets import load_dataset

ds = load_dataset("json", data_files="train.jsonl", split="train")
print(ds[0])

Примечание

Побочные датасеты (например, связанные с цензурой и другими категориями) пока не публикуются — они хранятся отдельно и будут выложены не скоро.