CoolFace
18 results

classical-chinese

gujilab /chinese-classical-corpus Chinese Classical Corpus 🔗 源码 & 构建脚本: github.com/gujilab/chinese-classical-corpus — 完整抽取 pipeline、14 个 Python 脚本、验证套件 🎯 配套评测基准: gujilab/chinese-classical-bench — 500 道题 × 5 任务,测 LLM 古典文献能力(题目均从本语料抽样) 中国古典文献结构化语料集,含完整十三经 + 说文解字 + 资治通鉴 + 二十四史前 15 部,以及 197 万条古译今/今译古/断句指令对。 全部 CC0 公有领域,可商用、可改用、无附加限制。 为什么做这个 中文(尤其文言文)常被说成"高密度优势"。本语料集 + 配套评测想把这个论点变成可验证的数字 —— 包括它在哪些场景成立、在哪些场景不成立。 Tokenizer 层面 —— 真成立 7 个主流 tokenizer 横评(tokenizer_study): DeepSeek-V3 /… See the full description on the dataset page: https://huggingface.co/datasets/gujilab/chinese-classical-corpus.texttext-generation1M<n<10M1 likes412 downloads4mo agoHugging Faceflowerone /chinese-classical-corpus Chinese Classical Corpus 🔗 Source code & build scripts: github.com/zi6me/chinese-classical-corpus — full extraction pipeline, 14 Python scripts, validation suite. 中国古典文献结构化语料集,含完整十三经 + 说文解字 + 资治通鉴 + 二十四史前 15 部,以及 197 万条古译今/今译古/断句指令对。 全部 CC0 公有领域,可商用、可改用、无附加限制。 Quick Start from datasets import load_dataset # 源语料 (12,005 条章节级记录, 17.2M 字) corpus = load_dataset("dzxr/chinese-classical-corpus", "corpus", split="train") # 古译今 / 今译古 双向指令数据 (1,924,378 条) translate =… See the full description on the dataset page: https://huggingface.co/datasets/flowerone/chinese-classical-corpus.texttext-generation1M<n<10M0 likes157 downloads5mo agoHugging Facekenpusney /greathangpt-classical-chinese GreatHanGPT 古汉语数据集 数据集描述 这是一个用于训练古汉语大语言模型的数据集,包含从先秦到清初(1644-1722)的汉语文献。 数据来源 来源 内容 链接 chinese-poetry 唐诗宋词、楚辞、诗经、四书五经 GitHub Werneror/Poetry 先秦到清末诗词,按朝代分 GitHub CBETA 大正藏佛经 GitHub 数据规模 指标 数值 总记录数 2,400,939 总字符数 450,496,972 估计token数 ~300M 时代分布 时代 记录数 字符数 占比 先秦 1,376 14,493,846 3.2% 汉魏 16,450 14,348,817 3.2% 隋唐 729,162 122,265,102 27.1% 两宋 728,569 97,907,260 21.7%… See the full description on the dataset page: https://huggingface.co/datasets/kenpusney/greathangpt-classical-chinese.tabulartext-generation1M<n<10M0 likes157 downloads3mo agoHugging Facexmj2002 /Chinese_modern_classical Dataset Card for "Chinese_modern_classical" 数据来自于NiuTrans/Classical-Modern: 非常全的文言文(古文)-现代文平行语料 (github.com)。 由于原始数据中部分古文没有译文,所以本数据集的数据仅包括了双语数据 。 texttranslation100K<n<1M48 likes133 downloads3y agoHugging FacePoetryMTEB /ClassicalChinesePoetryThemeClassification Classical Chinese Poetry Theme Classification Multi-class theme classification of classical Chinese poetry for PoetryMTEB embedding evaluation. Upstream: A thematic classification dataset for Classical Chinese poetry (Hou, Harvard Dataverse, DOI), with Hou & Zhang, JOCH 2024 (paper). Nearly 3,000 annotated poems across seven themes (Chunqiu → Qing). Dataset Card Item Description Dataset version (PoetryMTEB) 1.0.1 Source Harvard Dataverse DVN/6QJ7RK… See the full description on the dataset page: https://huggingface.co/datasets/PoetryMTEB/ClassicalChinesePoetryThemeClassification.texttext-classification1K<n<10K0 likes88 downloads2mo agoHugging FaceSeikaijyu /Classical-Chinese-Roleplay 文言文角色扮演 本数据集包含了579条文言文多轮对话(同时包含短指令) 这是一个奇奇怪怪的数据集,说它是文言文,其实只是看起来像文言文的白话文 数据集中存在一些过短的指令,可以根据情况剔除相应语料 训练此数据集可以让你的模型变得(看似)文采飞扬 至少能看起来有文笔,对吧? textn<1K14 likes76 downloads2y agoHugging Face