LLiserginov/russian_parables
russian_parables Датасет русскоязычных притч, собранный с сайта Библиотека Мудрости (wisdomlib.ru). Содержимое 2994 притчи в формате JSONL (одна строка = один JSON-объект) с полями: Поле Тип Описание id int Внутренний id притчи на сайте wisdomlib.ru title str Название притчи text str Полный текст притчи category str Категория (основная рубрика) Пример строки: { "id": 10470, "title": "Притча о прощении (Умирает женщина)", "text":… See the full description on the dataset page: https://huggingface.co/datasets/LLiserginov/russian_parables.
russian_parables
Датасет русскоязычных притч, собранный с сайта Библиотека Мудрости (wisdomlib.ru).
Содержимое
2994 притчи в формате JSONL (одна строка = один JSON-объект) с полями:
Пример строки:
{
"id": 10470,
"title": "Притча о прощении (Умирает женщина)",
"text": "Умирает женщина, и к ней приходит Смерть.\n\n— К чему ты готова? — спросила Смерть\n...",
"category": "Современные притчи"
}Текст хранится с переносами строк (\n) вместо HTML-тегов <br>. HTML-сущности (—, –, … и т.п.) раскодированы в символы Юникода.
Категории
32 категории. Топ по количеству притч:
Статистика
- Всего записей: 2994
- Длина текста (в символах): средняя ≈ 1711, медиана ≈ 1008, мин. 42, макс. 52 903
- Пустых названий/текстов/категорий: нет
Как использовать
import json
with open("russian_parables.jsonl", encoding="utf-8") as f:
parables = [json.loads(line) for line in f if line.strip()]
print(parables[0]["title"])Через datasets:
from datasets import load_dataset
ds = load_dataset("json", data_files="russian_parables.jsonl")Источник и лицензия
- Источник: wisdomlib.ru — «Библиотека Мудрости»
- URL страницы притчи:
https://wisdomlib.ru/pritcha/{id} - Лицензия:
unknown. Датасет собран автоматически с открытых страниц сайта. Перед коммерческим использованием уточните права на контент у правообладателя (wisdomlib.ru, авторство притч принадлежит их авторам и традициям).
