Rwigle/C-MORAL-Mistral-GDPO
0
C-MORAL Mistral GDPO Adapters
This repository contains LoRA adapters released for C-MORAL:
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs
These adapters are trained on top of:
mistralai/Mistral-7B-Instruct-v0.3
using:
GDPO
for controllable multi-objective molecular optimization.
Available Task Subfolders
Each task is stored as a separate subfolder in this Hugging Face repository.
abmp:amp+bbbp+mutag+plogpacep:amp+carc+herg+plogpbcmq:bbbp+carc+mutag+qedbdeq:bbbp+drd2+herg+qedbdpq:bbbp+drd2+qed+plogpbpq:bbbp+plogp+qedcde:carc+drd2+hergdhmq:drd2+hia+mutag+qedelq:herg+liv+qedhlmpq:hia+liv+mutag+plogp+qed
Usage
Load a task-specific adapter with PEFT by setting subfolder to the desired task name.
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base_model_id = "mistralai/Mistral-7B-Instruct-v0.3"
adapter_repo = "Rwigle/C-MORAL-Mistral-GDPO"
task_subfolder = "bpq" # change to abmp / elq / hlmpq / ...
tokenizer = AutoTokenizer.from_pretrained(base_model_id)
model = AutoModelForCausalLM.from_pretrained(base_model_id)
model = PeftModel.from_pretrained(model, adapter_repo, subfolder=task_subfolder)Method
- Base model:
mistralai/Mistral-7B-Instruct-v0.3 - Adapter type:
LoRA - Training algorithm:
GDPO - Domain: multi-objective molecular optimization
Project
- GitHub:
https://github.com/Rwigie/C-MORAL
Citation
If you use these adapters, please cite:
C-MORAL: Controllable Multi-Objective Molecular Optimization with
Reinforcement Alignment for LLMs