CoolFace
Datasetpublic

allura-org/instruct-ppo-mix-20k

Input dataset for PPO training, made out of a random subset of 10k rows from Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k and a 10k rows subset from arcee-ai/EvolKit-20k. Converted to OpenRLHF prompt dataset format.

sourceHugging Faceupdated 2y agoView on Hugging Face
1likes5downloads
Dataset Card

Input dataset for PPO training, made out of a random subset of 10k rows from Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k and a 10k rows subset from arcee-ai/EvolKit-20k. Converted to OpenRLHF prompt dataset format.