CoolFace
Datasetpublic

saidutta69/red-pill-drug-discovery-formulation

๐Ÿ”ด RED-PILL Research Enhanced Dataset for Pharmaceutical Innovation in Learning & Language The first open instruction-tuning dataset for drug discovery & formulation development. Built for fine-tuning Heretic-ablated models that won't refuse your pharmaceutical R&D questions. โšก Quick Start from datasets import load_dataset # Load the full dataset ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation"โ€ฆ See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/red-pill-drug-discovery-formulation.

sourceHugging Faceapache-2.0updated 14d agoView on Hugging Face
0likes124downloads
Dataset Card

<div align="center">

<img src="https://photu.kashyalabanavli.site/racer-is-op.png" alt="RACER IS OP" width="100%">

๐Ÿ”ด RED-PILL

Research Enhanced Dataset for Pharmaceutical Innovation in Learning & Language

<br/>

![License](LICENSE) ![HuggingFace](https://huggingface.co/datasets/saidutta69/red-pill-drug-discovery-formulation) ![Size]() ![Format]() ![Tasks]() ![Quality]()

<br/>

The first open instruction-tuning dataset for drug discovery & formulation development.

Built for fine-tuning Heretic-ablated models that won't refuse your pharmaceutical R&D questions.


</div>

โšก Quick Start

python
from datasets import load_dataset

# Load the full dataset
ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation", data_files="red-pill-full.jsonl")

# Load gold tier (elite 17 instructions)
ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation", data_files="red-pill-full_gold_tier.jsonl")

# Load top tier (145 grade A+B instructions)
ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation", data_files="red-pill-full_top_tier.jsonl")

๐Ÿ“Š Dataset at a Glance

<div align="center">

SplitInstructionsAvg ScoreDescription
Full1,0470.541Complete dataset across all pillars
Gold Tier ๐Ÿฅ‡170.757Elite grade-A instructions
Top Tier ๐Ÿฅˆ145โ€”Grade A+B instructions

</div>

๐ŸŽฏ Quality Distribution

Grade A (โ‰ฅ0.75):  โ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘  17 (1.6%)
Grade B (โ‰ฅ0.60):  โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘  128 (12.2%)
Grade C (โ‰ฅ0.45):  โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆ  789 (75.3%)
Grade D (โ‰ฅ0.30):  โ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘  102 (9.7%)
Grade F (<0.30):  โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘  11 (1.1%)

๐Ÿงฌ The Six Pillars

<div align="center">

PillarInstructionsFocus
๐Ÿงช Drug Discovery631Target ID, screening, ADMET, molecular properties
๐Ÿ’Š Formulation โญ62Solubility enhancement, dosage forms, excipients, stability
โš—๏ธ Synthesis16Retrosynthesis, reaction optimization, process chemistry
๐Ÿ“‹ Regulatory109FDA guidance, clinical trial design, patent analysis
๐Ÿ”— Integration4Cross-pillar reasoning, drug repurposing
๐Ÿ“š Literature402Paper analysis, methodology critique, research synthesis

</div>

<details> <summary><b>๐Ÿ“‹ Pillar Details (Click to expand)</b></summary>

๐Ÿงช Pillar 1: Drug Discovery & Screening

631 instructions

  • โ€”Target identification & validation
  • โ€”Virtual screening workflows
  • โ€”Molecular property prediction
  • โ€”ADMET profiling & optimization
  • โ€”Hit-to-lead optimization
  • โ€”Structure-activity relationships

Sources: ChEMBL 35, DrugBank, PubChem, Expert Knowledge

๐Ÿ’Š Pillar 2: Formulation Development โญ Key Differentiator

62 instructions

  • โ€”Solubility enhancement strategies (ASD, nanosizing, cyclodextrins)
  • โ€”Dosage form design & selection
  • โ€”Excipient science & compatibility
  • โ€”Stability prediction & optimization
  • โ€”Dissolution modeling & IVIVC
  • โ€”QbD and Design Space concepts

Sources: FDA Orange Book, FormulationAI, Expert Knowledge

โš—๏ธ Pillar 3: Chemical Synthesis

16 instructions

  • โ€”Retrosynthetic analysis
  • โ€”Reaction optimization
  • โ€”Process chemistry & scale-up
  • โ€”Crystallization & polymorph control
  • โ€”Green chemistry principles

Sources: ChEMBL, Process Chemistry Knowledge Base

๐Ÿ“‹ Pillar 4: Regulatory & Clinical

109 instructions

  • โ€”FDA guidance interpretation
  • โ€”Clinical trial design (Phase I-IV)
  • โ€”Bioequivalence requirements
  • โ€”Stability testing (ICH Q1A-R2)
  • โ€”ANDA/NDA filing strategy

Sources: ClinicalTrials.gov, FDA Guidance Documents

๐Ÿ”— Pillar 5: Cross-cutting Integration

4 instructions

  • โ€”Drug repurposing scenarios
  • โ€”Formulation-to-clinic pipelines
  • โ€”Failure analysis & rescue strategies
  • โ€”Multi-pillar reasoning exercises

Sources: Integrated Knowledge Base

๐Ÿ“š Pillar 6: Literature Mining

402 instructions

  • โ€”Paper summary & analysis
  • โ€”Methodology critique
  • โ€”Cross-paper synthesis
  • โ€”Research trend identification
  • โ€”Computational method assessment

Sources: PubMed (274 papers), arXiv (21 papers)

</details>


๐Ÿ“‹ Data Format

Each instruction follows the ChatML format with rich metadata:

json
{
  "messages": [
    {
      "role": "user",
      "content": "I have a BCS Class II compound with solubility 0.5 ยตg/mL and LogP 4.2..."
    },
    {
      "role": "assistant",
      "content": "## Solubility Enhancement Strategy\n\n### Compound Profile:\n- **Solubility:** 0.5 ยตg/mL (very poor)\n- **LogP:** 4.2 (lipophilic)\n..."
    }
  ],
  "metadata": {
    "pillar": "formulation",
    "domain": "solubility enhancement",
    "skill_type": "requires-reasoning",
    "source": "formulation_knowledge_base",
    "difficulty": "expert"
  }
}

๐Ÿ“Š Metadata Fields

FieldValuesDescription
pillardiscovery, formulation, synthesis, regulatory, literature, integrationPrimary domain
domain30+ subdomainsSpecific topic area
skill_typerequires-knowledge, requires-calculation, requires-reasoning, requires-decisionCognitive skill tested
difficultybasic, intermediate, advanced, expertComplexity level
sourcechembl, pubmed, arxiv, fdaorangebook, formulation_kb, etc.Data provenance

๐ŸŽฏ Quality Scoring System

Every instruction is scored across 8 dimensions:

DimensionWeightWhat It Measures
Response Depth15%Length, detail, specific numbers, examples
Technical Richness15%Domain terminology density, drug names, concentrations
Educational Structure12%Headers, lists, bold terms, step-by-step format
Multi-Turn Engagement12%Conversation depth, coherence across turns
Practical Applicability15%Actionable advice, real-world context, decision-making
Domain Specificity13%Pharmaceutical terminology concentration
Reasoning Complexity8%Analytical vs. purely factual content
Formulation Depth10%Formulation-specific knowledge (key differentiator)

๐Ÿ† Grade Scale

GradeScoreDescription
A ๐Ÿฅ‡โ‰ฅ0.75Excellent โ€” deep, structured, technical, actionable
B ๐Ÿฅˆโ‰ฅ0.60Good โ€” solid content, some structure
Cโ‰ฅ0.45Average โ€” basic content, limited structure
Dโ‰ฅ0.30Below average โ€” thin content
F<0.30Poor โ€” not useful for fine-tuning

๐Ÿ”ฌ Evaluation Benchmarks

The dataset includes 32 evaluation questions across 5 categories:

CategoryQuestionsDifficulty
Knowledge Recall5Intermediate-Advanced
Reasoning3Expert
Formulation Design3Expert
Decision Making2Expert
Molecular Analysis2Advanced-Expert
Gold Tier (auto)17Expert

Run Evaluation

bash
# Download benchmark
python -c "
from datasets import load_dataset
ds = load_dataset('saidutta69/red-pill-drug-discovery-formulation', data_files='benchmarks/benchmark_suite.json')
ds['train'].to_json('benchmark_suite.json')
"

# Run evaluation (after generating model responses)
python benchmarks/evaluate.py \
    --responses your_model_responses.jsonl \
    --benchmark benchmark_suite.json

๐Ÿš€ Recommended Fine-Tuning Setup

Base Model

Any Heretic-ablated model works:

ModelParametersLicense
p-e-w/llama-3-8b-it-heretic8BLlama 3
p-e-w/mistral-7b-instruct-v0.3-heretic7BApache 2.0
p-e-w/qwen2-7b-instruct-heretic7BApache 2.0

Training Configuration

python
from transformers import TrainingArguments
from peft import LoraConfig

# LoRA config (recommended for Heretic models)
lora_config = LoraConfig(
    r=16,
    lora_alpha=32,
    target_modules=["q_proj", "v_proj", "k_proj", "o_proj"],
    lora_dropout=0.05,
    bias="none",
    task_type="CAUSAL_LM",
)

# Training args
training_args = TrainingArguments(
    output_dir="./red-pill-heretic",
    num_train_epochs=3,
    per_device_train_batch_size=4,
    gradient_accumulation_steps=8,
    learning_rate=2e-5,
    weight_decay=0.01,
    warmup_ratio=0.1,
    lr_scheduler_type="cosine",
    fp16=True,
    logging_steps=10,
    save_strategy="epoch",
)

โฑ๏ธ Expected Training Time

DatasetTime (Single GPU)
Gold tier (17 examples)~5 minutes
Top tier (145 examples)~30 minutes
Full dataset (1,047 examples)~3 hours

๐Ÿ“ˆ Data Sources & Provenance

SourceRecordsAccess
ChEMBL 35498 drugs, 1,000 bioactivitiesOpen API
PubMed274 papersOpen API
arXiv21 papers (filtered from 83)Open API
ClinicalTrials.gov109 trial recordsOpen API
FDA Orange BookFormulation compositionsOpen CSV
Formulation Knowledge BaseExpert-generatedSynthetic
Drug Discovery Knowledge BaseExpert-generatedSynthetic

โš ๏ธ Disclaimer

This dataset is for research purposes only. It should not be used as the sole basis for pharmaceutical decisions. Always consult qualified professionals for drug development activities.

The knowledge contained in this dataset reflects publicly available information and expert opinions. It may not represent the current state of the art in all areas.


๐Ÿ“š Citation

bibtex
@dataset{red_pill_2025,
  title={RED-PILL: Research Enhanced Dataset for Pharmaceutical Innovation in Learning and Language},
  author={Saidutta Abhishek Dash},
  year={2025},
  publisher={Hugging Face},
  url={https://huggingface.co/datasets/saidutta69/red-pill-drug-discovery-formulation},
  description={Instruction-tuning dataset for drug discovery and formulation development.}
}

๐Ÿ“„ License

Apache License 2.0


<div align="center">

Built with ๐Ÿ”ด by [Saidutta](https://huggingface.co/saidutta69)

Fine-tune models that won't refuse your pharmaceutical R&D questions.

<br/>

<img src="https://huggingface.co/datasets/huggingface/badges/resolve/main/processed-with-%F0%9F%A4%97%20%2F%20%F0%9F%93%8D-light.svg" alt="Made with HuggingFace"/>

</div>