datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
patristics-scholastics
Scholastic corpus — OCR + repair sidecars + lemmata + apparatus
Four public-domain scholastic editions as region-grain OCR plus additive quality-repair,
lemmatization, and citation-apparatus layers: Parma (Aquinas), Borgnet–Vivès (Albertus
Magnus), Quaracchi (Bonaventure), Vivès–Wadding (Duns Scotus). 99 volumes; corpus='sch'.
Gated access
This repo is manually gated: approval is required before viewing or downloading any config.
Every config on this repo is… See the full description on the dataset page: https://huggingface.co/datasets/NuBerea/patristics-scholastics.classical-arabic-scholastic-bilingual-corpus
Classical Arabic Scholastic Bilingual Corpus (70,192 Pairs)
Dataset Summary
The Classical Arabic Scholastic Bilingual Corpus is a curated, dense-semantic parallel dataset designed for high-fidelity translation between Classical Arabic and Academic English. It covers foundational texts across Classical Islamic Philosophy (Falsafah), Dialectical Theology (Kalām), Legal Epistemology (Uṣūl al-Fiqh), Hadith Commentary, and Spiritual Realization (Taṣawwuf).
The dataset… See the full description on the dataset page: https://huggingface.co/datasets/enver/classical-arabic-scholastic-bilingual-corpus.
