datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
question-type-and-complexity
Question Type and Complexity (QTC) Dataset
Dataset Overview
The Question Type and Complexity (QTC) dataset is a comprehensive resource for linguistics/NLP research focusing on question classification and linguistic complexity analysis across multiple languages. It contains questions from two distinct sources (TyDi QA and Universal Dependencies v2.15), automatically annotated with question types (polar/content) and a set of linguistic complexity features.
Key Features:
2… See the full description on the dataset page: https://huggingface.co/datasets/rokokot/question-type-and-complexity.parallel-complexity-med-textclinical-quad-site-training-protocol-complexity-error-rate-data-usability-v0.1Clinical Quad Site Training Protocol Complexity Error Rate Data Usability v0.1
Each row is a site week snapshot.
Core quad
Site training intensityProtocol complexityOperational error rateData usability
Target
label_data_collapse_next_60d
Files
data/train.csvdata/tester.csvscorer.py
Evaluation
Run model on data/tester.csvReturn predictions row alignedScore with scorer.py
License
MIT
DEITA-Complexity-Top1kSQuAD_V2_Computational_complexity_theorymulti-complexity-med-qa
Multi‑Level Medical QA Dataset
A curated CSV dataset featuring medical questions and their answers rewritten at varying complexity levels, with extensive linguistic feature annotations.
🧠 Overview
Purpose: Train and evaluate readability-aware generative models by providing answers tailored to audiences from laypersons to medical professionals.
Size & Coverage:
~180,000 rows covering (question_id, answer_id) pairs.
Multiple answer variants per question across… See the full description on the dataset page: https://huggingface.co/datasets/DNivalis/multi-complexity-med-qa.babylm-tagged-by-common-complexity-metrics
