CoolFace
Datasetpublic

dac-research/longbench_synthetic_v3

LongBench Synthetic V3 Dataset statistics Per-subset stats over uploaded samples. Unique ctx counts distinct context strings, while the context-length buckets count samples/rows. Token counts use Qwen/Qwen3-14B. Pool Subset Unique ctx Sample rows <8K 8-16K 16-32K >32K Median tok p90 tok Max tok eval 2wikimqa 197 197 139 54 4 0 6,627 13,271 16,982 eval gov_report 200 200 89 84 24 3 8,902 18,212 52,521 eval musique 200 200 3 46 151 0 16,733 17,231 17… See the full description on the dataset page: https://huggingface.co/datasets/dac-research/longbench_synthetic_v3.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes21downloads
Dataset Card

LongBench Synthetic V3

Dataset statistics

Per-subset stats over uploaded samples. Unique ctx counts distinct context strings, while the context-length buckets count samples/rows. Token counts use Qwen/Qwen3-14B.

PoolSubsetUnique ctxSample rows<8K8-16K16-32K>32KMedian tokp90 tokMax tok
eval2wikimqa19719713954406,62713,27116,982
evalgov_report20020089842438,90218,21252,521
evalmusique200200346151016,73317,23117,824
evalqasper14820018710304,6747,46921,879
evalqmsum352004010852012,97025,53930,377
evalsamsum20020088104809,21514,93017,987
trainhotpotqa2001,600216880504014,98216,94717,578
trainhotpotqa_e2882,3049281,12025609,69316,53017,322
trainmulti_news1991,5921,55240002,0484,83414,278
trainmultinewse2822,2561,336736152326,76815,22641,048
trainmultifieldqa_en112896504384807,71212,00416,446
trainnarrativeqa20160048486431,29660,32765,301
traintriviaqa2001,600536680384011,53019,60023,284
traintriviaqa_e2992,3921,18485634488,28917,66936,186

Train pool: 1,600 unique contexts → 12,800 question rows (split into HF train + validation). Eval pool: 980 unique contexts → 1,197 question rows (uploaded as HF test).