datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
big_russian_dialogueЭтот датасет содержит извлечённые диалоги из множества русскоязычных книг, аккуратно отформатированные в стиле ShareGPT. Он предназначен для обучения языковых моделей в формате ролевого общения, с выделением действий звёздочками.
Формат:
Каждый диалог оформлен в структуре ShareGPT.
Действия персонажей выделены звёздочками.
Поддерживается использование в моделях ролевого общения.
Объём данных:
Общий размер: ~1 ГБ.
Источник: Различные книги на русском языке.
Применение:
Этот датасет может… See the full description on the dataset page: https://huggingface.co/datasets/Hoaxer2000/big_russian_dialogue.samantha-dialogues-ru
Samantha Dialogues — Русская локализация
...
(и дальше по шаблону)
Samantha Dialogues — Русская локализация
Этот датасет содержит переведённую на русский язык версию оригинального англоязычного набора диалогов с виртуальной ассистенткой Самантой. Оригинальные английские данные взяты из открытого датасета.
🧠 Назначение
Дообучение чат-ботов и LLM моделей на русском языке
Создание более человечных виртуальных ассистентов на русском
Ролевые диалоги и симуляция… See the full description on the dataset page: https://huggingface.co/datasets/Hoaxer2000/samantha-dialogues-ru.hoax_trainingAuthor: Jonathan HarrisonPublisher: Hugging FaceDOI: 10.57967/hf/6275URL: https://huggingface.co/datasets/Raiff1982/hoax_training
📖 Overview
hoax_training is a curated dataset designed to train and evaluate conversational AI models like Codette on misinformation detection, source verification, and ethical guidance.
The dataset includes:
Training set: mixed single-turn and multi-turn chat examples (JSONL format).
Validation set: focused one-shot Q&A examples for evaluation… See the full description on the dataset page: https://huggingface.co/datasets/Raiff1982/hoax_training.
