saidutta69/red-pill-drug-discovery-formulation
๐ด RED-PILL Research Enhanced Dataset for Pharmaceutical Innovation in Learning & Language The first open instruction-tuning dataset for drug discovery & formulation development. Built for fine-tuning Heretic-ablated models that won't refuse your pharmaceutical R&D questions. โก Quick Start from datasets import load_dataset # Load the full dataset ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation"โฆ See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/red-pill-drug-discovery-formulation.
<div align="center">
<img src="https://photu.kashyalabanavli.site/racer-is-op.png" alt="RACER IS OP" width="100%">
๐ด RED-PILL
Research Enhanced Dataset for Pharmaceutical Innovation in Learning & Language
<br/>
  ![Size]() ![Format]() ![Tasks]() ![Quality]()
<br/>
The first open instruction-tuning dataset for drug discovery & formulation development.
Built for fine-tuning Heretic-ablated models that won't refuse your pharmaceutical R&D questions.
</div>
โก Quick Start
from datasets import load_dataset
# Load the full dataset
ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation", data_files="red-pill-full.jsonl")
# Load gold tier (elite 17 instructions)
ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation", data_files="red-pill-full_gold_tier.jsonl")
# Load top tier (145 grade A+B instructions)
ds = load_dataset("saidutta69/red-pill-drug-discovery-formulation", data_files="red-pill-full_top_tier.jsonl")๐ Dataset at a Glance
<div align="center">
</div>
๐ฏ Quality Distribution
Grade A (โฅ0.75): โโโโโโโโโโโโโโโโโโโโ 17 (1.6%)
Grade B (โฅ0.60): โโโโโโโโโโโโโโโโโโโโ 128 (12.2%)
Grade C (โฅ0.45): โโโโโโโโโโโโโโโโโโโโ 789 (75.3%)
Grade D (โฅ0.30): โโโโโโโโโโโโโโโโโโโโ 102 (9.7%)
Grade F (<0.30): โโโโโโโโโโโโโโโโโโโโ 11 (1.1%)๐งฌ The Six Pillars
<div align="center">
</div>
<details> <summary><b>๐ Pillar Details (Click to expand)</b></summary>
๐งช Pillar 1: Drug Discovery & Screening
631 instructions
- Target identification & validation
- Virtual screening workflows
- Molecular property prediction
- ADMET profiling & optimization
- Hit-to-lead optimization
- Structure-activity relationships
Sources: ChEMBL 35, DrugBank, PubChem, Expert Knowledge
๐ Pillar 2: Formulation Development โญ Key Differentiator
62 instructions
- Solubility enhancement strategies (ASD, nanosizing, cyclodextrins)
- Dosage form design & selection
- Excipient science & compatibility
- Stability prediction & optimization
- Dissolution modeling & IVIVC
- QbD and Design Space concepts
Sources: FDA Orange Book, FormulationAI, Expert Knowledge
โ๏ธ Pillar 3: Chemical Synthesis
16 instructions
- Retrosynthetic analysis
- Reaction optimization
- Process chemistry & scale-up
- Crystallization & polymorph control
- Green chemistry principles
Sources: ChEMBL, Process Chemistry Knowledge Base
๐ Pillar 4: Regulatory & Clinical
109 instructions
- FDA guidance interpretation
- Clinical trial design (Phase I-IV)
- Bioequivalence requirements
- Stability testing (ICH Q1A-R2)
- ANDA/NDA filing strategy
Sources: ClinicalTrials.gov, FDA Guidance Documents
๐ Pillar 5: Cross-cutting Integration
4 instructions
- Drug repurposing scenarios
- Formulation-to-clinic pipelines
- Failure analysis & rescue strategies
- Multi-pillar reasoning exercises
Sources: Integrated Knowledge Base
๐ Pillar 6: Literature Mining
402 instructions
- Paper summary & analysis
- Methodology critique
- Cross-paper synthesis
- Research trend identification
- Computational method assessment
Sources: PubMed (274 papers), arXiv (21 papers)
</details>
๐ Data Format
Each instruction follows the ChatML format with rich metadata:
{
"messages": [
{
"role": "user",
"content": "I have a BCS Class II compound with solubility 0.5 ยตg/mL and LogP 4.2..."
},
{
"role": "assistant",
"content": "## Solubility Enhancement Strategy\n\n### Compound Profile:\n- **Solubility:** 0.5 ยตg/mL (very poor)\n- **LogP:** 4.2 (lipophilic)\n..."
}
],
"metadata": {
"pillar": "formulation",
"domain": "solubility enhancement",
"skill_type": "requires-reasoning",
"source": "formulation_knowledge_base",
"difficulty": "expert"
}
}๐ Metadata Fields
๐ฏ Quality Scoring System
Every instruction is scored across 8 dimensions:
๐ Grade Scale
๐ฌ Evaluation Benchmarks
The dataset includes 32 evaluation questions across 5 categories:
Run Evaluation
# Download benchmark
python -c "
from datasets import load_dataset
ds = load_dataset('saidutta69/red-pill-drug-discovery-formulation', data_files='benchmarks/benchmark_suite.json')
ds['train'].to_json('benchmark_suite.json')
"
# Run evaluation (after generating model responses)
python benchmarks/evaluate.py \
--responses your_model_responses.jsonl \
--benchmark benchmark_suite.json๐ Recommended Fine-Tuning Setup
Base Model
Any Heretic-ablated model works:
Training Configuration
from transformers import TrainingArguments
from peft import LoraConfig
# LoRA config (recommended for Heretic models)
lora_config = LoraConfig(
r=16,
lora_alpha=32,
target_modules=["q_proj", "v_proj", "k_proj", "o_proj"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM",
)
# Training args
training_args = TrainingArguments(
output_dir="./red-pill-heretic",
num_train_epochs=3,
per_device_train_batch_size=4,
gradient_accumulation_steps=8,
learning_rate=2e-5,
weight_decay=0.01,
warmup_ratio=0.1,
lr_scheduler_type="cosine",
fp16=True,
logging_steps=10,
save_strategy="epoch",
)โฑ๏ธ Expected Training Time
๐ Data Sources & Provenance
โ ๏ธ Disclaimer
This dataset is for research purposes only. It should not be used as the sole basis for pharmaceutical decisions. Always consult qualified professionals for drug development activities.
The knowledge contained in this dataset reflects publicly available information and expert opinions. It may not represent the current state of the art in all areas.
๐ Citation
@dataset{red_pill_2025,
title={RED-PILL: Research Enhanced Dataset for Pharmaceutical Innovation in Learning and Language},
author={Saidutta Abhishek Dash},
year={2025},
publisher={Hugging Face},
url={https://huggingface.co/datasets/saidutta69/red-pill-drug-discovery-formulation},
description={Instruction-tuning dataset for drug discovery and formulation development.}
}๐ License
Apache License 2.0
<div align="center">
Built with ๐ด by [Saidutta](https://huggingface.co/saidutta69)
Fine-tune models that won't refuse your pharmaceutical R&D questions.
<br/>
<img src="https://huggingface.co/datasets/huggingface/badges/resolve/main/processed-with-%F0%9F%A4%97%20%2F%20%F0%9F%93%8D-light.svg" alt="Made with HuggingFace"/>
</div>
