koushik1212/synthetic-diabetes-hypertension-NCD-screening-WHO-HEARTS
Synthetic Diabetes & Hypertension NCD Screening Dataset (Adults 18–80) Abstract This dataset provides 30,000 synthetic records (10,000 per scenario) of adults undergoing NCD screening at LMIC health facilities or community campaigns. Each record contains 27 variables including demographics, anthropometry (BMI, waist circumference), lifestyle risk factors (smoking, alcohol, physical activity), family history, clinical measurements (blood pressure, fasting glucose… See the full description on the dataset page: https://huggingface.co/datasets/koushik1212/synthetic-diabetes-hypertension-NCD-screening-WHO-HEARTS.
Synthetic Diabetes & Hypertension NCD Screening Dataset (Adults 18–80)
Abstract
This dataset provides 30,000 synthetic records (10,000 per scenario) of adults undergoing NCD screening at LMIC health facilities or community campaigns. Each record contains 27 variables including demographics, anthropometry (BMI, waist circumference), lifestyle risk factors (smoking, alcohol, physical activity), family history, clinical measurements (blood pressure, fasting glucose, HbA1c, lipid profile), NCD classifications (diabetes/prediabetes, hypertension staging), 10-year CVD risk estimation, and treatment status. All distributions are parameterized from IDF Diabetes Atlas, NCD-RisC global analyses, WHO HEARTS package, and WHO STEPS surveys. Three burden scenarios span diabetes prevalence from 13% to 40% and hypertension from 40% to 60%.
This dataset is entirely synthetic. It must not be used for clinical decision-making.
2. Methodology
2.1 Epidemiological Parameterization
2.2 Scenario Design
2.3 Classification Criteria
3. Schema
4. Validation
<p align="center"> <img src="validation_report.png" alt="Validation Report" width="100%"> </p>
5. Usage
from datasets import load_dataset
dataset = load_dataset("electricsheepafrica/synthetic-diabetes-hypertension-NCD-screening-WHO-HEARTS", "moderate_ncd_burden")
df = dataset["train"].to_pandas()6. Limitations
- Synthetic: Not for clinical use or population-level estimates.
- Simplified CVD risk: Uses a simplified scoring; real WHO/ISH charts are sex/region/age stratified.
- No longitudinal data: Single screening snapshot; no disease progression.
- Treatment simplification: Binary treatment status; no medication classes or adherence data.
- No renal function: Creatinine/eGFR not modelled despite relevance to diabetes/HTN.
7. References
- IDF (2021). IDF Diabetes Atlas, 10th edition.
- WHO (2021). Global report on hypertension. Geneva.
- NCD-RisC (2024). Worldwide trends in diabetes. Lancet, 404(10467):2077-2093.
- Zhou B, et al. (2021). Worldwide trends in hypertension. Lancet, 398(10304):957-980.
- WHO (2020). HEARTS Technical package. Geneva.
- ADA (2023). Standards of Medical Care in Diabetes. Diabetes Care, 46(S1).
- WHO STEPS Surveys. NCD risk factor surveillance, multiple countries.
Citation
@dataset{esa_ncd_2025,
title={Synthetic Diabetes and Hypertension NCD Screening Dataset},
author={Electric Sheep Africa},
year={2025},
publisher={Hugging Face},
url={https://huggingface.co/datasets/electricsheepafrica/synthetic-diabetes-hypertension-NCD-screening-WHO-HEARTS}
}