cnshD/Kangxi-Dictionary-V1.0
康熙字典原子级结构化与多标准对齐数据集 (KangXi Dictionary Structured Dataset) 📖 项目简介 (Introduction) 本数据集是一个针对经典古籍《康熙字典》进行原子级深度清洗、多源标准对齐与数字化重构的高质量开源知识库。通过多轮严格的脚本清洗、繁体规范化、画数纯数字转化以及异体字/地区标准对齐,将全量近 47,000 条字符数据打造成为一个兼具学术考证价值与现代机器友好性(Machine-Readable)的顶级古汉字数字资产。 📊 数据规模与核心指标 (Dataset Overview) 总记录条目数:46,981 条 涵盖内容:字头、拼音、IDS 字符结构树、地区标准说明(大陆 GB、台湾 CNS、日本 JIS、韩国 KS 等)、所属集与部首、总画与余画(纯数字格式)、Unicode 统一码、反切读音、原典古释义。 版权保护:内嵌全局数字指纹(SHA-256)及逐条明文系统版本标识(system_V1.0_ID)。… See the full description on the dataset page: https://huggingface.co/datasets/cnshD/Kangxi-Dictionary-V1.0.
康熙字典原子级结构化与多标准对齐数据集 (KangXi Dictionary Structured Dataset)
📖 项目简介 (Introduction)
本数据集是一个针对经典古籍《康熙字典》进行原子级深度清洗、多源标准对齐与数字化重构的高质量开源知识库。通过多轮严格的脚本清洗、繁体规范化、画数纯数字转化以及异体字/地区标准对齐,将全量近 47,000 条字符数据打造成为一个兼具学术考证价值与现代机器友好性(Machine-Readable)的顶级古汉字数字资产。
📊 数据规模与核心指标 (Dataset Overview)
- 总记录条目数:46,981 条
- 涵盖内容:字头、拼音、IDS 字符结构树、地区标准说明(大陆 GB、台湾 CNS、日本 JIS、韩国 KS 等)、所属集与部首、总画与余画(纯数字格式)、Unicode 统一码、反切读音、原典古释义。
- 版权保护:内嵌全局数字指纹(SHA-256)及逐条明文系统版本标识(
system_V1.0_ID)。
🗂️ 核心字段结构说明 (Schema Definition)
本数据集采用规范的 JSON 格式存储,每个条目的核心字段包括:
id: 条目唯一检索标识字: 康熙字典原典字头拼音: 现代汉语拼音字结构: Unicode 标准 IDS 原子结构树字結構說明: 地区标准归属对照所屬集/所屬部: 字典收录归属与部首總畫/餘畫: 经清洗的纯数字笔画数統一碼: 国际标准 Unicode 编码讀音: 传统反切与音韵标注古釋義: 原汁原味的《康熙字典》训诂释义system_V1.0_ID: 逐条明文版权与系统版本指纹标识(位于条目底部)
🛡️ 数字版权与开源声明 (License & Watermark)
- 开源许可:采用 CC BY-NC 4.0 协议授权,仅限学术研究与非商业开源交流使用。
- 数字水印防护:内嵌全局加密数字指纹及逐条明文追踪 ID,有效保护开源成果。
license: cc-by-nc-4.0 language:
- zh prettyname: KangXi-Dictionary-Structured taskcategories:
- text-classification tags:
- kangxi
- kangxi-dictionary
- chinese-characters
- digital-humanities
- nlp
- historical-text size_categories:
- 10K<n<100K ---
