kenpusney/greathangpt-classical-chinese
GreatHanGPT 古汉语数据集 数据集描述 这是一个用于训练古汉语大语言模型的数据集,包含从先秦到清初(1644-1722)的汉语文献。 数据来源 来源 内容 链接 chinese-poetry 唐诗宋词、楚辞、诗经、四书五经 GitHub Werneror/Poetry 先秦到清末诗词,按朝代分 GitHub CBETA 大正藏佛经 GitHub 数据规模 指标 数值 总记录数 2,400,939 总字符数 450,496,972 估计token数 ~300M 时代分布 时代 记录数 字符数 占比 先秦 1,376 14,493,846 3.2% 汉魏 16,450 14,348,817 3.2% 隋唐 729,162 122,265,102 27.1% 两宋 728,569 97,907,260 21.7%… See the full description on the dataset page: https://huggingface.co/datasets/kenpusney/greathangpt-classical-chinese.
0144
GreatHanGPT 古汉语数据集
数据集描述
这是一个用于训练古汉语大语言模型的数据集,包含从先秦到清初(1644-1722)的汉语文献。
数据来源
数据规模
时代分布
内容分类
数据格式
Parquet格式,包含以下列:
使用方法
from datasets import load_dataset
# 加载完整数据集
dataset = load_dataset("your-username/greathangpt-classical-chinese")
# 按时代加载
dataset = load_dataset("your-username/greathangpt-classical-chinese", split="隋唐")
# 用pandas加载
import pandas as pd
df = pd.read_parquet("all.parquet")数据示例
标题: 帝京篇十首 一
作者: 太宗皇帝
朝代: 唐
文本: 秦川雄帝宅,函谷壯皇居。綺殿千尋起,離宮百雉餘。連甍遙接漢,飛觀迥凌虛。雲日隱層闕,風煙出綺疎。时代划分
- 先秦: 公元前221年以前(夏商周、春秋战国)
- 汉魏: 公元前221年 - 公元581年(秦汉魏晋南北朝)
- 隋唐: 公元581年 - 公元960年(隋唐五代)
- 两宋: 公元960年 - 公元1368年(宋辽金元)
- 明清: 公元1368年 - 公元1722年(明至清康熙)
数据处理
数据经过以下处理:
- 统一格式化为JSON
- 按时代和内容分类
- 文本清洗(去除多余空白)
- 转换为Parquet格式
许可证
Apache 2.0
引用
@dataset{greathangpt2026,
title={GreatHanGPT Classical Chinese Dataset},
author={GreatHanGPT Team},
year={2026},
url={https://huggingface.co/datasets/kenpusney/greathangpt-classical-chinese}
}