CoolFace
Datasetpublic

kenpusney/greathangpt-classical-chinese

GreatHanGPT 古汉语数据集 数据集描述 这是一个用于训练古汉语大语言模型的数据集,包含从先秦到清初(1644-1722)的汉语文献。 数据来源 来源 内容 链接 chinese-poetry 唐诗宋词、楚辞、诗经、四书五经 GitHub Werneror/Poetry 先秦到清末诗词,按朝代分 GitHub CBETA 大正藏佛经 GitHub 数据规模 指标 数值 总记录数 2,400,939 总字符数 450,496,972 估计token数 ~300M 时代分布 时代 记录数 字符数 占比 先秦 1,376 14,493,846 3.2% 汉魏 16,450 14,348,817 3.2% 隋唐 729,162 122,265,102 27.1% 两宋 728,569 97,907,260 21.7%… See the full description on the dataset page: https://huggingface.co/datasets/kenpusney/greathangpt-classical-chinese.

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes144downloads
Dataset Card

GreatHanGPT 古汉语数据集

数据集描述

这是一个用于训练古汉语大语言模型的数据集,包含从先秦到清初(1644-1722)的汉语文献。

数据来源

来源内容链接
chinese-poetry唐诗宋词、楚辞、诗经、四书五经GitHub
Werneror/Poetry先秦到清末诗词,按朝代分GitHub
CBETA大正藏佛经GitHub

数据规模

指标数值
总记录数2,400,939
总字符数450,496,972
估计token数~300M

时代分布

时代记录数字符数占比
先秦1,37614,493,8463.2%
汉魏16,45014,348,8173.2%
隋唐729,162122,265,10227.1%
两宋728,56997,907,26021.7%
明清778,075122,658,14127.2%
未分类147,30778,823,80617.5%

内容分类

分类记录数字符数占比
集(诗词文集)2,395,680176,025,96039.1%
佛(佛经)5,191274,335,97860.9%
经(儒家经典)68135,0340.03%

数据格式

Parquet格式,包含以下列:

列名类型说明
idstring唯一标识
titlestring标题/篇名
authorstring作者
dynastystring朝代
erastring大时代分类
content_categorystring内容分类(经/史/子/集/佛)
sourcestring数据来源
textstring完整文本
paragraphsstring段落(换行分隔)
char_countint64字符数
paragraph_countint64段落数

使用方法

python
from datasets import load_dataset

# 加载完整数据集
dataset = load_dataset("your-username/greathangpt-classical-chinese")

# 按时代加载
dataset = load_dataset("your-username/greathangpt-classical-chinese", split="隋唐")

# 用pandas加载
import pandas as pd
df = pd.read_parquet("all.parquet")

数据示例

标题: 帝京篇十首 一
作者: 太宗皇帝
朝代: 唐
文本: 秦川雄帝宅,函谷壯皇居。綺殿千尋起,離宮百雉餘。連甍遙接漢,飛觀迥凌虛。雲日隱層闕,風煙出綺疎。

时代划分

  • —先秦: 公元前221年以前(夏商周、春秋战国)
  • —汉魏: 公元前221年 - 公元581年(秦汉魏晋南北朝)
  • —隋唐: 公元581年 - 公元960年(隋唐五代)
  • —两宋: 公元960年 - 公元1368年(宋辽金元)
  • —明清: 公元1368年 - 公元1722年(明至清康熙)

数据处理

数据经过以下处理:

  1. 1.统一格式化为JSON
  2. 2.按时代和内容分类
  3. 3.文本清洗(去除多余空白)
  4. 4.转换为Parquet格式

许可证

Apache 2.0

引用

bibtex
@dataset{greathangpt2026,
  title={GreatHanGPT Classical Chinese Dataset},
  author={GreatHanGPT Team},
  year={2026},
  url={https://huggingface.co/datasets/kenpusney/greathangpt-classical-chinese}
}