julian-schelb/latin-classical-intertextuality-queries
Latin Classical Intertextuality Queries This dataset contains query texts used for finding intertextual relationships with classical Latin authors. It comprises the whole works of Hieronymus (Jerome) and Lactantius, which are searched against a corpus of classical Latin literature. It is part of a larger collection focused on detecting intertextual relationships between Jerome (Hieronymus), Lactantius and classical Latin literature. Related Datasets This queries… See the full description on the dataset page: https://huggingface.co/datasets/julian-schelb/latin-classical-intertextuality-queries.
Latin Classical Intertextuality Queries
This dataset contains query texts used for finding intertextual relationships with classical Latin authors. It comprises the whole works of Hieronymus (Jerome) and Lactantius, which are searched against a corpus of classical Latin literature. It is part of a larger collection focused on detecting intertextual relationships between Jerome (Hieronymus), Lactantius and classical Latin literature.
Related Datasets
This queries dataset is part of the Latin Jerome Intertextuality collection:
- Queries: latin-classical-intertextuality-queries - The whole works of Hieronymus and Lactantius are used as queries for finding intertextual relationships (referencing authors).
- Corpus: latin-classical-intertextuality-corpus - As corpus a selection of Classical Latin authors serving as retrieval target for intertextuality search. The authors are: Catullus, Cicero, Horatius, Lucanus, Lucretius, Martial, Ovidius, Propertius, Tibullus, Vergilius (referenced authors).
- Labels: latin-classical-intertextuality-labels - Ground truth labels of verified intertextual relationships between Jerome + Lactantius and a selection of classical authors.
Dataset Description
- Domain: Classical philology and digital humanities
Dataset Structure
Each entry contains the following structured fields:
id: Unique identifier for each text passagetext: Cleaned Latin text passage (primary field for retrieval)text_original: Original text before cleaningcitation: Citation or position information
Usage
Example usage of the dataset with the Hugging Face datasets library:
from datasets import load_dataset
queries = load_dataset("julian-schelb/latin-classical-intertextuality-queries", split="train")
print(f"Queries size: {len(queries)}")
print(queries[0])Project Affiliation
This work was supported by the German Research Foundation (DFG, Forschungsgemeinschaft) in the project "Zitieren als narrative Strategie. Eine digital-hermeneutische Untersuchung von Intertextualitätsphänomenen am Beispiel des Briefcorpus des Kirchenlehrers Hieronymus." \[Grant ID: 382880410\]
Click here to learn more about this project.
Contributors
This dataset is the result of a collaborative effort: Prof. Barbara Feichtinger, Dr. Marie Revellio, Michael Wittweiler, Franziska Schropp, Julian Schelb, Jun.-Prof. Dr. Andreas Spitz. This is not an exhaustive list, and we are grateful to all individuals who have supported this project in any capacity.
Citation
Please cite this dataset as follows:
@misc{schelb2026locisimilesbenchmarkextracting,
title={Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature},
author={Julian Schelb and Michael Wittweiler and Marie Revellio and Barbara Feichtinger and Andreas Spitz},
year={2026},
eprint={2601.07533},
archivePrefix={arXiv},
primaryClass={cs.IR},
url={https://arxiv.org/abs/2601.07533},
}Sources
The query texts in this dataset are sourced from the following digital repositories and critical editions:
