jncraton/ccel-paragraphs
CCEL Paragraphs Dataset Description Dataset Summary This dataset includes all paragraphs from the Christian Classics Ethereal Library. It also includes scripture references extracted from the ThML. Supported Tasks and Leaderboards It is expected that this dataset can be used as part of the training pipeline for large language models. In particular, it could be used to create a clustering benchmark by using scripture references as… See the full description on the dataset page: https://huggingface.co/datasets/jncraton/ccel-paragraphs.
Add description for author info
Upload dataset
Update readme
Add license to metadata
Remove license images
Use markdown for license
Properly escape quotes
Fence JSON
Update readme
Add source ThML
Adjust logging
Add ccel/removed.txt
Add script to prune non-free xml files
Upload README.md with huggingface_hub
Upload data/train-00019-of-00020-fb252f743dfc5f84.parquet with huggingface_hub
Upload data/train-00018-of-00020-e4fa3794b99d9db0.parquet with huggingface_hub
Upload data/train-00017-of-00020-5f702278e63db5a9.parquet with huggingface_hub
Upload data/train-00016-of-00020-c460c1a05038e8df.parquet with huggingface_hub
Upload data/train-00015-of-00020-26462b3791aa6924.parquet with huggingface_hub
Upload data/train-00014-of-00020-354ac613e4ff0bc0.parquet with huggingface_hub
Upload data/train-00013-of-00020-6c057e0bbff0416f.parquet with huggingface_hub
Upload data/train-00012-of-00020-90ed0442c967f81c.parquet with huggingface_hub
Upload data/train-00011-of-00020-3847ede39fc3e7ce.parquet with huggingface_hub
Upload data/train-00010-of-00020-d0c1e92a8a7dc9cd.parquet with huggingface_hub
Upload data/train-00009-of-00020-6d30ff68ee5db8a9.parquet with huggingface_hub
Upload data/train-00008-of-00020-e07920f30d841f26.parquet with huggingface_hub
Upload data/train-00007-of-00020-7da616373cc96bf9.parquet with huggingface_hub
Upload data/train-00006-of-00020-4ca8278bb9279967.parquet with huggingface_hub
Upload data/train-00005-of-00020-624a29758adccc13.parquet with huggingface_hub
Upload data/train-00004-of-00020-83ec7bbdd50c875a.parquet with huggingface_hub
Upload data/train-00003-of-00020-749bff9e21d54e17.parquet with huggingface_hub
Upload data/train-00002-of-00020-45fb8c0ad1b003d5.parquet with huggingface_hub
Upload data/train-00001-of-00020-92a97958284c134a.parquet with huggingface_hub
Upload data/train-00000-of-00020-91dfbd4c17b6e760.parquet with huggingface_hub
Add title, author, and year metadata
Skip content under copyright
Add ccel/.gitignore
Rename generation script
Add docstring
Store embeddings and log during run
Reformat with black
Update README.md
Update README.md
Upload README.md with huggingface_hub
Update README.md
Upload parse.py
Update README.md
Librarian Bot: Add language metadata for dataset (#2)
Upload README.md with huggingface_hub
Upload README.md with huggingface_hub
