julian-schelb/latin-classical-intertextuality-corpus
Latin Classical Authors Corpus This dataset contains processed texts from classical Latin authors, serving as a retrieval corpus for intertextuality research. It is part of a larger collection focused on detecting intertextual relationships between Jerome (Hieronymus), Cicero and classical Latin literature. Related Datasets This corpus is part of the Latin Jerome Intertextuality collection: Queries: latin-classical-intertextuality-queries - The whole works of… See the full description on the dataset page: https://huggingface.co/datasets/julian-schelb/latin-classical-intertextuality-corpus.
Latin Classical Authors Corpus
This dataset contains processed texts from classical Latin authors, serving as a retrieval corpus for intertextuality research. It is part of a larger collection focused on detecting intertextual relationships between Jerome (Hieronymus), Cicero and classical Latin literature.
Related Datasets
This corpus is part of the Latin Jerome Intertextuality collection:
- Queries: latin-classical-intertextuality-queries - The whole works of Hieronymus and Lactantius are used as queries for finding intertextual relationships (referencing authors).
- Corpus: latin-classical-intertextuality-corpus - As corpus a selection of Classical Latin authors serving as retrieval target for intertextuality search. The authors are: Catullus, Cicero, Horatius, Lucanus, Lucretius, Martial, Ovidius, Propertius, Tibullus, Vergilius (referenced authors).
- Labels: latin-classical-intertextuality-labels - Ground truth labels of verified intertextual relationships between Jerome + Lactantius and a selection of classical authors.
Dataset Description
- Domain: Classical philology and digital humanities
Dataset Structure
Each entry contains the following structured fields:
id: Unique identifier for each text passagetext: Cleaned Latin text passage (primary field for retrieval)text_original: Original text before cleaningcitation: Citation or position information
Usage
Example usage of the dataset with the Hugging Face datasets library:
from datasets import load_dataset
corpus = load_dataset("julian-schelb/latin-classical-intertextuality-corpus", split="train")
print(f"Corpus size: {len(corpus)}")
print(corpus[0])Project Affiliation
This work was supported by the German Research Foundation (DFG, Forschungsgemeinschaft) in the project "Zitieren als narrative Strategie. Eine digital-hermeneutische Untersuchung von Intertextualitätsphänomenen am Beispiel des Briefcorpus des Kirchenlehrers Hieronymus." \[Grant ID: 382880410\]
Click here to learn more about this project.
Contributors
This dataset is the result of a collaborative effort: Prof. Barbara Feichtinger, Dr. Marie Revellio, Michael Wittweiler, Franziska Schropp, Julian Schelb, Jun.-Prof. Dr. Andreas Spitz. This is not an exhaustive list, and we are grateful to all individuals who have supported this project in any capacity.
Citation
Please cite this dataset as follows:
@misc{schelb2026locisimilesbenchmarkextracting,
title={Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature},
author={Julian Schelb and Michael Wittweiler and Marie Revellio and Barbara Feichtinger and Andreas Spitz},
year={2026},
eprint={2601.07533},
archivePrefix={arXiv},
primaryClass={cs.IR},
url={https://arxiv.org/abs/2601.07533},
}Sources
The texts in this corpus are sourced from the following digital repositories and critical editions:
