VibrantVista/style-judge-dataset
Style Judge Dataset A pairwise dataset for learning a continuous style-similarity function while controlling for topic, introduced in Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning (arXiv:2512.05747). Dataset Summary Total rows: 156k (default subset) Splits: train 130k, validation 13k, test 13k Format: Arrow Columns sentence1 (string): original chunk text sentence2 (string): refilled chunk text score… See the full description on the dataset page: https://huggingface.co/datasets/VibrantVista/style-judge-dataset.
Style Judge Dataset
A pairwise dataset for learning a continuous style-similarity function while controlling for topic, introduced in Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning (arXiv:2512.05747).
Dataset Summary
- Total rows: 156k (default subset)
- Splits: train 130k, validation 13k, test 13k
- Format: Arrow
Columns
sentence1(string): original chunk textsentence2(string): refilled chunk textscore(float): calibrated similarity score in [0, 1]subject(string): one of 4 subject categoriesauthor1,author2(string): author identifiers for each sidebook1,book2(string): book identifiers for each sideid1,id2(string): example ids
Source Data (Books)
General dataset size: 978 books (strict pairs only)
Subject breakdown:
Loading
from datasets import load_dataset
ds = load_dataset("VibrantVista/style-judge-dataset")
train = ds["train"]
valid = ds["validation"]
test = ds["test"]Citation
@misc{liu2025capturingclassicauthorialstyle,
title={Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning},
author={Jinlong Liu and Mohammed Bahja and Venelin Kovatchev and Mark Lee},
year={2025},
eprint={2512.05747},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2512.05747},
}