cnshD/Kangxi-Dictionary-V1.0
康熙字典原子级结构化与多标准对齐数据集 (KangXi Dictionary Structured Dataset) 📖 项目简介 (Introduction) 本数据集是一个针对经典古籍《康熙字典》进行原子级深度清洗、多源标准对齐与数字化重构的高质量开源知识库。通过多轮严格的脚本清洗、繁体规范化、画数纯数字转化以及异体字/地区标准对齐,将全量近 47,000 条字符数据打造成为一个兼具学术考证价值与现代机器友好性(Machine-Readable)的顶级古汉字数字资产。 📊 数据规模与核心指标 (Dataset Overview) 总记录条目数:46,981 条 涵盖内容:字头、拼音、IDS 字符结构树、地区标准说明(大陆 GB、台湾 CNS、日本 JIS、韩国 KS 等)、所属集与部首、总画与余画(纯数字格式)、Unicode 统一码、反切读音、原典古释义。 版权保护:内嵌全局数字指纹(SHA-256)及逐条明文系统版本标识(system_V1.0_ID)。… See the full description on the dataset page: https://huggingface.co/datasets/cnshD/Kangxi-Dictionary-V1.0.
This repository belongs to cnshD on Hugging Face.
CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.
