RLAIF/WritingPrompts-Filtered
WritingPrompts Filtered Dataset (LitBench Decontaminated) Dataset Description This dataset contains filtered and decontaminated WritingPrompts from Reddit, specifically processed to remove any overlap with the LitBench test set. This ensures clean training data for language models without test set contamination. Processing Statistics Generated: 2025-09-12 Dataset Size Original dataset: 265174 entries After decontamination: 199,248… See the full description on the dataset page: https://huggingface.co/datasets/RLAIF/WritingPrompts-Filtered.
0185
Add comprehensive dataset card with statistics
Upload filtered WritingPrompts dataset - 199,248 entries
initial commit
