allura-org/instruct-ppo-mix-20k
Input dataset for PPO training, made out of a random subset of 10k rows from Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k and a 10k rows subset from arcee-ai/EvolKit-20k. Converted to OpenRLHF prompt dataset format.
13
Update README.md
Create README.md
Fix system role getting swapped with user
Upload train_ppo.jsonl
initial commit
