onurborasahin/DARPA_Lift_2026
AgAb DB: Antigen Specific Antibody Database A comprehensive collection of antibody-antigen interaction data for computational biology and therapeutic design. Dataset Summary AgAb DB aggregates antibody-antigen binding data from multiple sources, containing over 1.2 million antibody-antigen pairs with binding affinity measurements. This dataset is essential for training machine learning models in computational immunology and antibody engineering. Key… See the full description on the dataset page: https://huggingface.co/datasets/onurborasahin/DARPA_Lift_2026.
AgAb DB: Antigen Specific Antibody Database
A comprehensive collection of antibody-antigen interaction data for computational biology and therapeutic design.
Dataset Summary
AgAb DB aggregates antibody-antigen binding data from multiple sources, containing over 1.2 million antibody-antigen pairs with binding affinity measurements. This dataset is essential for training machine learning models in computational immunology and antibody engineering.
Key Statistics
- 1,227,083 antibody-antigen interaction records
- 309,884 unique antibodies (full antibodies, nanobodies, scFvs)
- 4,334 unique antigens
- 170,660 complete heavy/light chain pairs
- 70,388 nanobodies and 132,157 scFv antibodies
- Focus on human health: Infectious diseases, cancer, autoimmune conditions
- Diverse antigen types: Viral proteins, bacterial antigens, cancer markers, autoantigens
Note: Statistics for unique antibodies/antigens are from original documentation and may be proportionally larger in the full 1.2M record dataset.
Data Quality Distribution
- 51% very_high confidence (robust sequences and methodology)
- high confidence (manually curated datasets)
- medium confidence (automated discovery, some uncertainty)
Affinity Measurement Types
- Quantitative metrics: Gibbs free energy changes, kinetic constants, IC₅₀
- Qualitative binding assessments
- Mixed data types across different sources
Data Structure
Core Fields
Additional Metadata
Dataset Split
- Train: All 1,227,083 records in a single training set
The full dataset is provided as a single training split to maximize available data for machine learning applications. Users can create their own validation/test splits as needed for their specific use cases.
Confidence Categories
- very_high: Both sequences and methodology used for calculating affinity were robust (e.g., AbDesign, BioMap, SKEMPI 2.0)
- high: Manually curated datasets or those containing antigen names/mutations rather than full sequences (e.g., FLAB datasets)
- medium: Automated data discovery with some uncertainty (e.g., patent databases)
Antibody Types Included
- Full antibodies: Complete heavy and light chain pairs (traditional monoclonal antibodies)
- Nanobodies: Single-domain antibodies (VHH format) - 70K+ entries across datasets
- scFv: Single-chain variable fragments - 132K+ entries, primarily from AlphaSeq
- Mixed formats: Various antibody fragment types and engineered variants
Nanobody Distribution by Source
scFv Distribution by Source
Sequence Characteristics
- Predominantly short sequences: <150 amino acids typical
- Majority include both chains: Heavy and light chain pairs
- Diverse antigen targets: Infectious diseases, cancer, autoimmune conditions
- Multiple affinity measurement types: KD, IC₅₀, ΔG, binary binding
Usage
Load the Dataset
from datasets import load_dataset
# Load from OpenMed
dataset = load_dataset("OpenMed/agab-db")
# Access the training data (full dataset)
train_data = dataset["train"]
# Optional: Create your own validation/test splits
from sklearn.model_selection import train_test_split
import pandas as pd
# Convert to pandas for splitting
df = pd.DataFrame(train_data)
train_df, test_df = train_test_split(df, test_size=0.1, random_state=42)
train_df, val_df = train_test_split(train_df, test_size=0.1, random_state=42)Filter for Research
# High-quality data only
high_quality = dataset.filter(lambda x: x["confidence"] == "very_high")
# Nanobodies for specialized studies
nanobodies = dataset.filter(lambda x: x["nanobody"] == True)
# Specific antigens
covid_data = dataset.filter(lambda x: "covid" in x["target_name"].lower())Prepare for ML Training
# Extract sequences for language models
sequences = []
for item in dataset["train"]:
if item["heavy_sequence"]:
sequences.append(item["heavy_sequence"])
if item["light_sequence"]:
sequences.append(item["light_sequence"])Applications
Machine Learning Use Cases
- Antibody language models: Train sequence models on antibody repertoires for generative design
- Binding affinity prediction: Develop regression models for antibody-antigen interaction strength
- Therapeutic design: Guide rational antibody engineering and optimization
- Computational immunology: Study immune responses and antibody development patterns
- Virtual screening: Prioritize antibody candidates for experimental validation
- Structure-affinity relationships: Learn connections between 3D structures and binding properties
Research Applications
- Antibody repertoire analysis: Study natural antibody diversity and evolution
- Cross-reactivity prediction: Identify potential off-target effects
- Immunogenicity assessment: Predict antibody developability and safety
- Drug discovery pipelines: Accelerate hit identification and lead optimization
- Comparative immunology: Study antibody responses across different species
Integration with Other Tools
- Protein structure prediction: Use with ESMFold for 3D structure generation
- Molecular dynamics: Combine with simulation tools for binding mechanism studies
- High-throughput screening: Guide experimental antibody library screening
- CRISPR engineering: Design antibodies for gene therapy applications
Data Sources
Aggregated from 25+ datasets including GenBank, SKEMPI 2.0, peer-reviewed publications, and patent databases.
Major Dataset Components
Inclusion Criteria
- Transparency and completeness of data
- Relevance to human health
- Quantitative binding affinity measurements
- Complete amino acid sequences for all biomolecules
Data Processing Pipeline
- Aggregation: Collection from 14 distinct sources → 25 integrated datasets
- Curation: Multi-stage pipeline with automated extraction, normalization, and manual verification
- Standardization: Common structure implemented across all studies
- Validation: Automated feasibility checks and manual verification of critical datasets
Citation
@dataset{agab_db,
title={AgAb DB: Antigen Specific Antibody Database},
author={NaturalAntibody},
year={2024},
url={https://naturalantibody.com/agab/}
}License
Available for non-commercial research use only. Contact NaturalAntibody for commercial licensing.
Dataset provided by [NaturalAntibody](https://naturalantibody.com/agab/)
