Nhoodie/omni-dna-sad-mutation-dataset
Omni-DNA SAD Mutation Dataset Synthetic and real DNA mutation pairs for training cross-domain HGT mutation prediction models. Files File Pairs Source synthetic_expanded.jsonl 8,112 ICI dual-model generation (Omni + HyenaDNA consensus) train.jsonl 3,317 Real NCBI sequences test.jsonl 826 Real NCBI sequences (held-out) Format Each line is a JSON object: {"parent": "ATGGCT...", "child": "ATAGCT..."} Generation Method… See the full description on the dataset page: https://huggingface.co/datasets/Nhoodie/omni-dna-sad-mutation-dataset.
Omni-DNA SAD Mutation Dataset
Synthetic and real DNA mutation pairs for training cross-domain HGT mutation prediction models.
Files
Format
Each line is a JSON object:
{"parent": "ATGGCT...", "child": "ATAGCT..."}Generation Method (Synthetic Data)
- Source: 1,014 real DNA sequences from diverse species
- FDI (Focus-Doped Interleaving): Every 3 codons (9 bp), a 1-codon (3 bp) gap is introduced
- Dual-model consensus: Omni-DNA-20M and HyenaDNA tiny-1k independently predict gap nucleotides
- Consensus tagging: Agreement =
consensus, disagreement =contested - 8 generation passes with different gap intervals (3-6) and seeds, then deduplicated
Key Statistics
Domains
Sequences sourced from NCBI across diverse prokaryotic and archaeal species for cross-domain HGT analysis.
SAD Coefficient
The synthetic-to-real exposure ratio used in training:
- SAD Coefficient = 4.89 (81,120 synthetic exposures / 16,585 real exposures)
- This is noted as too high — a coefficient of ~1.5 is recommended for future runs
Citation
If using this dataset, please also cite:
