CoolFace
Datasetpublic

aweffr/chinese-novel-continuation-precise-tokens

中文小说续写精确 Token 长度数据集 基于金庸《神雕侠侣》的高精度中文文本生成数据集,专为 GPU 内存测试和序列长度性能分析而设计。 数据集特点 高精度:99.4%+ 的目标 token 长度准确率 多种长度:5 个变体(1024、2048、4096、8192、16384 tokens) 统一格式:Alpaca 格式的小说续写任务 质量控制:95%+ 样本在目标长度的 ±2% 范围内 数据集统计 目标 Tokens 实际平均 准确率 样本数 文件大小 ±1% 内样本 ±2% 内样本 1024 1017.9 99.4% 800 2.5MB 739 775 2048 2037.7 99.5% 800 4.9MB 764 795 4096 4078.1 99.6% 800 9.8MB 792 800 8192 8158.1 99.6% 800 19.5MB 800 800 16384 16317.6 99.6% 800 39.1MB 800 800… See the full description on the dataset page: https://huggingface.co/datasets/aweffr/chinese-novel-continuation-precise-tokens.

sourceHugging Faceupdated 1y agoView on Hugging Face
4likes41downloads
Dataset Card

中文小说续写精确 Token 长度数据集

基于金庸《神雕侠侣》的高精度中文文本生成数据集,专为 GPU 内存测试和序列长度性能分析而设计。

数据集特点

  • —高精度:99.4%+ 的目标 token 长度准确率
  • —多种长度:5 个变体(1024、2048、4096、8192、16384 tokens)
  • —统一格式:Alpaca 格式的小说续写任务
  • —质量控制:95%+ 样本在目标长度的 ±2% 范围内

数据集统计

目标 Tokens实际平均准确率样本数文件大小±1% 内样本±2% 内样本
10241017.999.4%8002.5MB739775
20482037.799.5%8004.9MB764795
40964078.199.6%8009.8MB792800
81928158.199.6%80019.5MB800800
1638416317.699.6%80039.1MB800800

数据格式

每个样本遵循 Alpaca 格式:

json
{
  "instruction": "续写小说",
  "input": "约500字的小说片段作为开头...",
  "output": "续写的小说内容,长度根据目标 token 数调整..."
}

文件说明

  • —novel_dataset_1024tokens.jsonl - 1K token 样本
  • —novel_dataset_2048tokens.jsonl - 2K token 样本
  • —novel_dataset_4096tokens.jsonl - 4K token 样本
  • —novel_dataset_8192tokens.jsonl - 8K token 样本
  • —novel_dataset_16384tokens.jsonl - 16K token 样本

使用场景

🔬 研究用途

  • —GPU 内存测试:精确的 token 长度用于内存需求分析
  • —序列长度基准测试:比较不同长度下的训练性能
  • —LoRA 微调:针对适配器训练场景优化
  • —中文文本生成:高质量文学文本用于语言建模

💡 技术应用

  • —训练模型显存占用分析
  • —不同序列长度的训练速度对比
  • —推理性能基准测试
  • —模型架构优化实验

技术细节

  • —来源:金庸《神雕侠侣》
  • —分词器:GPT-4o tokenizer 用于精确 token 计数
  • —语言:简体中文
  • —任务类型:小说续写/创意写作
  • —文本质量:专业文学作品,词汇丰富,句式复杂

数据生成方法

  1. 1.文本预处理:从原著中提取并清理文本段落
  2. 2.分层片段管理:按长度分类文本片段(大/中/小/微型)
  3. 3.精确组装算法:先用大片段快速逼近目标,再用小片段精确调整
  4. 4.质量控制:只接受误差在 5% 范围内的样本
  5. 5.最终验证:使用 GPT-4o tokenizer 进行最终 token 计数验证

样本示例

json
{
  "instruction": "续写小说",
  "input": "此刻再临旧地,但见荆草莽莽,空山寂寂,早几日下的大雪,已尽融化,仍毫无有人到过的迹象,奔到断肠崖前,走过石梁,抚着石壁上小龙女用剑尖划下的字迹,手指嵌入每个字的笔划之中,一笔一划的将石缝中的青苔揩去...",
  "output": "国师背上受了石块撞击,强运内力护住,一时虽不发作,其实内伤着实不轻,无力再起脚挑动石块,他知道只消再迟片刻,便即陷身石阵,达尔巴徒有勇力,不明阵法,难以相救..."
}

使用建议

训练配置

  • —建议使用 fp16 或 bf16 混合精度训练
  • —根据 GPU 内存大小选择合适的 batch size
  • —长序列建议使用梯度检查点(gradient checkpointing)

性能优化

  • —8K+ 序列建议使用 Flash Attention
  • —可以使用本数据集测试不同优化策略的效果
  • —建议先在短序列上验证模型,再逐步增加长度

许可证

本数据集仅用于研究和教育目的。请尊重原作品的版权。