CoolFace
Datasetpublic

godwei123/storyweaver-writing-zh

StoryWeaver 中文写作质量评测集 12 道按写作失效模式反推设计的中文创作题、4 个参赛者写出的 48 篇章节、432 条逐维度两两判决(含裁判完整推理原文)。 来自 StoryWeaver 的写作质量评测轨道。榜单:https://storyweaver.cn/benchmark-writing.html 核心结论 接系统比换一代底模更管用。同一底模接上多 Agent 系统后的胜率:k2.5 **75.1%**、k2.6 **60.2%**;而 k2.5(系统) 对 k2.6(裸) 是 70.3%,反过来只有 37.2%——系统加持能把旧一代底模抬过裸的新一代底模。系统档拿下 22 个维度里的 20 个榜首,包括全部 9 个负向维度。 k2.5 与 k2.6 之间 54.7%,落在噪音带内,不构成结论。 题目怎么设计的 每道题咬住 rubric 里的一个维度或负向维度,用硬约束逼出功力:… See the full description on the dataset page: https://huggingface.co/datasets/godwei123/storyweaver-writing-zh.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
1likes76downloads
Dataset Card

StoryWeaver 中文写作质量评测集

12 道按写作失效模式反推设计的中文创作题、4 个参赛者写出的 48 篇章节、432 条逐维度两两判决(含裁判完整推理原文)。

来自 StoryWeaver 的写作质量评测轨道。榜单:<https://storyweaver.cn/benchmark-writing.html>

核心结论

接系统比换一代底模更管用。同一底模接上多 Agent 系统后的胜率:k2.5 75.1%、k2.6 60.2%;而 k2.5(系统) 对 k2.6(裸) 是 70.3%,反过来只有 37.2%——系统加持能把旧一代底模抬过裸的新一代底模。系统档拿下 22 个维度里的 20 个榜首,包括全部 9 个负向维度。

k2.5 与 k2.6 之间 54.7%,落在噪音带内,不构成结论。

题目怎么设计的

每道题咬住 rubric 里的一个维度或负向维度,用硬约束逼出功力:

  • —「全章只有对白」——除最简提示语外不许有任何动作、神态、环境、心理描写,人物关系和潜台词必须全从话里透出来
  • —「600 字讲完一个完整转折」——考反冗游拖沓
  • —「写一个拒绝改变的人」——考反廉价的转变
  • —「全章不许任何人对这件事作出评判」——考反说教,连旁白替读者总结都不许

约束越锋利,平庸的写法越藏不住。12 道题全部达标(难判率最高 33%、最低 2%,超过 1/3 说明该题分不出高下)。

文件

cases.jsonl(12 行)— 题目

字段说明
case_id题目 ID
title标题
genre题材
prompt完整题面,含硬约束
tags考察维度
fixture引用的世界设定(见 fixture_documents.jsonl)

chapters.jsonl(48 行)— 参赛作品

12 题 × 4 个参赛者。字段:case_id / participant / mode(bare 裸模型 or system 完整系统)/ model / trial / text / chars。

judgments.jsonl(432 行)— 判决

字段说明
case_id题目
jia / yi甲位、乙位的参赛者名
picks22 个维度各自选了谁
judge_reasoning裁判完整推理原文

每对正反两序各判一遍(甲乙互换),所以同一组合会出现两条记录——这是有意为之,用来抵消位置偏见,不是重复数据。

fixture_documents.jsonl(4 行)— 世界设定

人物卡与前情,题目引用它们才完整。

leaderboard.json

Bradley-Terry 实力分、两两胜率矩阵、22 维分维度结果、每题难判率、rubric_sha 与 git_sha。

评测方法

  • —相对判定,不打绝对分。裁判每次只回答"这两篇哪篇更好"
  • —匿名 + 位置互换。裁判不知道章节出自谁;每对正反两序各问一遍
  • —多遍采样。每对采样 3 遍,票数汇总成连续胜率,避免单次二元判定的高平局率
  • —裁判异家族。claude-sonnet-5,与被测 kimi 不同家族,避免自我偏好

⚠️ 裁判必须先校准

上线前用同一批章节比过两个候选裁判,它们给出的名次完全相反:

候选裁判位置一致率备注
glm-5.129.7%45.6% 的判定无脑选甲位
claude-sonnet-567.8%采用

省掉这步直接跑满,会得到一个看着很有底气、实则纯由位置偏见产生的结论。任何复用本数据集方法的人都建议先做这一步。

另注:22 维下的一致率显著低于切分轨道 3 维时的 82%——维度越多,裁判越难保持稳定。

已知限制

  • —样本量小。12 题 × 4 参赛者,k2.5 与 k2.6 的差异落在噪音带内。系统 vs 裸的差异幅度够大,但也只在这批题上成立。
  • —题目分布有偏。专为区分度设计,不代表真实写作任务的分布。
  • —四个参赛者均未锁文风。系统支持锁定作家文风,本轮跑的都是通用模式。文风是审美选择而非能力高低——先前用某个文风试跑,结果是「情感投入」维度断层第一、却在「连贯性」「遵循指令」上垫底,这种此消彼长无法用一个名次概括。
  • —裁判是 LLM,与人类偏好的相关性未在本轮验证。

来源与致谢

本数据集只包含原创素材。以下外部素材虽被原项目使用,但未包含在此:

  • —评分 rubric 改编自 EQ-Bench creative-writing-bench(作者 Samuel J. Paech)的 22 维评分体系,本地化为中文。原项目无独立 LICENSE,故本数据集不转发 rubric 文本,仅在此致谢并给出链接。
  • —原项目另有 20 道题的梗概取自 WebNovelBench(MIT,Copyright (c) 2025 Great Oedon),因其衍生自真实小说,本数据集不包含这些题目。

引用

bibtex
@misc{storyweaver-writing-zh,
  title  = {StoryWeaver 中文写作质量评测集},
  author = {GodweiLL},
  year   = {2026},
  url    = {https://huggingface.co/datasets/godwei123/storyweaver-writing-zh}
}

许可证 CC-BY-4.0。章节正文由 Kimi 系列模型生成,判决文本由 claude-sonnet-5 生成。