CoolFace
Datasetpublic

jerry982/BioFactory-Asian-Oral-Microbiome-Preview

🦷 World's First Chinese-Anchored Oral Multi-Omics Synthetic Dataset (v2026) 3,872 production records · PERMANOVA p=0.994 · MMD=0.060 · 100% synthetic = zero GDPR risk 📄 Full Whitepaper · 📋 1-Page Executive Summary · 🔬 38-Sample Preview · 📧 Enterprise: jerry820402@hotmail.com English Executive Summary This is the world's first Asian/Chinese-specific oral microbiome multi-omics synthetic dataset, generated via Evo foundation model inference on 8× NVIDIA A800… See the full description on the dataset page: https://huggingface.co/datasets/jerry982/BioFactory-Asian-Oral-Microbiome-Preview.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes31downloads
Dataset Card

🦷 World's First Chinese-Anchored Oral Multi-Omics Synthetic Dataset (v2026)

3,872 production records · PERMANOVA p=0.994 · MMD=0.060 · 100% synthetic = zero GDPR risk

📄 **Full Whitepaper** · 📋 **1-Page Executive Summary** · 🔬 **38-Sample Preview** · 📧 Enterprise: jerry820402@hotmail.com


English Executive Summary

This is the world's first Asian/Chinese-specific oral microbiome multi-omics synthetic dataset, generated via Evo foundation model inference on 8× NVIDIA A800 DDP. Each record links genomic sequence + 10-taxon abundance profile + clinical triplet (periodontal / cardiovascular / diabetes).

After Cyclic Dirichlet manifold calibration, the full 3,872-record cohort passed enterprise B2B audit: PERMANOVA p=0.994, MMD=0.060, clinical triplet p=0.415 — statistically indistinguishable from real Han-Chinese oral cohorts.

100% synthetic · zero natural persons · GDPR / cross-border clinical data exempt.


中文摘要

全球首个华人锚定口腔多组学全合成数据集,基于 8 卡 A800 + Evo 分布式推理,每条样本包含基因序列、菌群丰度、临床三元组标签。经 Cyclic Dirichlet 流形校准后,3872 条生产数据终局审计 OVERALL PASSED(PERMANOVA p=0.994,MMD=0.060)。100% 合成,零合规风险,面向药企 AI 训模与口腔器械智能化场景。


Audit Bulletin (Production-Verified)

Audit DimensionMethodResultStatus
Community Structure FidelityPERMANOVAp = 0.994✅ PASSED
High-Dimensional ManifoldMMD0.060✅ PASSED
Clinical Triplet DistributionPERMANOVAp = 0.415✅ PASSED
Alpha Diversity (Shannon)Mann–Whitney Up = 0.599✅ PASSED
Mean Abundance CorrelationSpearmanr = 1.000✅ PASSED

Full production set: n=3,872 · Reference cohort: n=30 Han-Chinese clinical samples


Repository Files

FileDescription
`preview_dataset.jsonl`38 stratified preview records (1% open-access sample)
`validate_preview.py`Run PERMANOVA / MMD audit locally in ~30 seconds
`docs/Asian_Oral_Microbiome_Whitepaper_v2026.md`Full technical & commercial whitepaper
`docs/Executive_OnePager_v2026.md`1-page summary for BD / LinkedIn / email

Quick Start (30 Seconds)

bash
git clone https://huggingface.co/datasets/jerry982/BioFactory-Asian-Oral-Microbiome-Preview
cd BioFactory-Asian-Oral-Microbiome-Preview
python validate_preview.py
python
import json

with open("preview_dataset.jsonl") as f:
    for line in f:
        rec = json.loads(line)
        print(rec["schema:identifier"], rec["abundanceIndex"], rec["periodontalCorrelation"])

Record Schema (Each JSON-L Line)

FieldDescription
generatedSequenceEvo-inferred nucleotide sequence
abundanceProfile10-taxon CHOMD compositional vector (sums to 1.0)
periodontalCorrelationPeriodontal disease correlation index
systemicRiskCardiovascular / diabetes risk scores
metabolicPathwayPredictionKEGG pathway predictions with confidence

Full Commercial License

ChannelDetails
Snowflake MarketplaceQuarterly incremental drops / exclusive enterprise buyout
Direct LicenseEncrypted zip (3,872 records) + Validation_Report.json + MD5

Contact: jerry820402@hotmail.com


Citation

bibtex
@dataset{biofactory_asian_oral_2026,
  title={Asian Oral Microbiome Multi-Omics Synthetic Dataset (v2026)},
  author={AI Bio-Data Factory Lab},
  year={2026},
  url={https://huggingface.co/datasets/jerry982/BioFactory-Asian-Oral-Microbiome-Preview}
}

Compliance

100% synthetic data — maps to zero natural persons — inherently exempt from GDPR and cross-border clinical genetic data restrictions.