datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
turkish-academic-theses-dataset
📚 Turkish Academic Theses Abstracts (TR/EN)
A large-scale bilingual (Turkish–English) collection of abstracts from Turkish academic theses (YÖK Ulusal Tez Merkezi).
This dataset focuses only on abstracts, provided in Turkish (abstract_tr) and English (abstract_en), suitable for summarization, translation, classification, and retrieval.
Records: ~650k abstracts (TR & EN)
Format: Parquet (.parquet) — fast & analytics-friendly
Language: 🇹🇷 Turkish + 🇬🇧 English (parallel abstracts… See the full description on the dataset page: https://huggingface.co/datasets/umutertugrul/turkish-academic-theses-dataset.French_Doctoral_Theses
[!NOTE]
Dataset origin: https://www.kaggle.com/datasets/antoinebourgois2/french-doctoral-thesis
Description
All french doctoral thesis metatdata scrapped from https://www.theses.fr
The dataset contains :
URL
Thesis title
Short description
Author name
Thesis director(s) informations
Research domain
Status ( defended / in preparation)
thesession-abc-promptscuni-bachelor-theses-style
Charles University Bachelor Theses — Style Features
Derived, text-free features of 66,138 bachelor's theses defended at
Charles University (Prague) in 2000–2026, and of their 132,024 supervisor
and opponent reviews. Built to study how student writing changed after the
arrival of large language models (ChatGPT, November 2022).
The dataset contains no full texts, abstracts, review texts or personal
names — only metadata, measurements computed from the texts, and word
counts. The… See the full description on the dataset page: https://huggingface.co/datasets/honza03210/cuni-bachelor-theses-style.kurdish-kurmanji-theses
Kurdish Kurmanji Academic Theses
A corpus of Kurdish Kurmanji (Northern Kurdish, Latin script) text extracted from academic theses indexed in YÖK Tez Merkezi, the Turkish national thesis repository.
Dataset Summary
Each record is a single thesis whose body text has been filtered to Kurmanji-only paragraphs. Non-Kurdish paragraphs (Turkish, Arabic, etc.) and structural noise (figure captions, table of contents entries, bare page numbers) were removed using the… See the full description on the dataset page: https://huggingface.co/datasets/muzaffercky/kurdish-kurmanji-theses.theses_fr_2013_2023
Dataset Card for "theses_fr_2013_2023"
More Information needed
africa-tunisia-liste-des-theses-doctorantes-de-l-ecole-veterinaire-recues-a5c538b1
Liste Des Theses Doctorantes De L Ecole Veterinaire Recues | Africa (Tunisia Open Data)
269 rows - 1 Africa country/area - 2017-2022 - 1 indicator - Engineered by Electric Sheep Africa
TL;DR
This dataset contains 269 rows from Tunisia Open Data, covering Liste Des Theses Doctorantes De L Ecole Veterinaire Recues. It is published as ML-ready Parquet with consistent Hugging Face metadata, source provenance, and analysis-friendly loading examples.… See the full description on the dataset page: https://huggingface.co/datasets/electricsheepafrica/africa-tunisia-liste-des-theses-doctorantes-de-l-ecole-veterinaire-recues-a5c538b1.theses-soutenues-en-france-depuis-1985
Thèses soutenues en France depuis 1985
[!NOTE]
Ce jeu de données Hugging Face est vide. Cette carte sert seulement à référencer le jeu de données Thèses soutenues en France depuis 1985 qui est disponible à l'adresse https://www.data.gouv.fr/datasets/61d42893146c465c7bbac85f
Description
Ce jeu de données contient les métadonnées des thèses de doctorat françaises soutenues depuis 1985.
Les données sont issues de theses.fr, le moteur de recherche des thèses de doctorat… See the full description on the dataset page: https://huggingface.co/datasets/french-open-data/theses-soutenues-en-france-depuis-1985.thesesmerged_theses_20250710_174831Greek_PhD_Theses_Corpus
Description
This dataset is a clean, AI-ready collection of 55,423 doctoral dissertations (1975–2025) sourced from OpenArchives.gr and didaktorika.gr.
The raw text has been processed using the glossapi pipeline—utilizing DeepSeek OCR and Docling—to ensure accurate capture of polytonic Greek and scientific symbols, standardized into clean Markdown for immediate NLP tasks.
--Greek PhD Theses Corpus v.1.0 is hosted on the Mozilla Data Collective platform and can be accessed at… See the full description on the dataset page: https://huggingface.co/datasets/glossAPI/Greek_PhD_Theses_Corpus.THESES-abstractsthesessiontheses-testmanu-theses_fr_2013_2023Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données huggingface.co/datasets/manu/theses_fr_2013_2023.
theses-en-cours-13-07-2023
theses_en_cours_13_07_2023
[!NOTE]
Ce jeu de données Hugging Face est vide. Cette carte sert seulement à référencer le jeu de données theses_en_cours_13_07_2023 qui est disponible à l'adresse https://www.data.gouv.fr/datasets/64b035003796e30e751c67e6
Description
Jeu de données extrait grâce à l'API Theses.fr (https://documentation.abes.fr/aidetheses/thesesfr/index.html#RecupererDonneesAPI). Il recense toutes les thèses en cours à date du 13 juillet 2023.
Les variables… See the full description on the dataset page: https://huggingface.co/datasets/french-open-data/theses-en-cours-13-07-2023.Theses
