CoolFace
Datasetpublic

DigitalIntelligenceCenter-of-ICMM/Baize-TCM-Corpus-for-Large-Language-Models-V3

白泽中医药大模型语料库 版本:3.0语料数量:157,438 条语言:中文领域:中医药(Traditional Chinese Medicine, TCM)格式:问答对(QA Pair)用途:中医药大模型训练、知识问答系统、语义理解研究 📚 简介 “白泽中医药大模型语料库”是一个专注于中医药领域的高质量问答语料集合,旨在支持中医药知识的数字化、智能化应用。语料库共包含 157,438 条 经过整理与校对的问答对,涵盖中医基础理论、中药学、方剂学、诊断学、针灸推拿、经典医籍、临床实践等多个子领域。 本语料库可广泛应用于: 中医药大语言模型的预训练与微调 智能问答系统开发 医学自然语言处理任务(如实体识别、关系抽取) 中医药知识图谱构建 🧩 数据内容 每条语料为一个标准的问答对,格式如下: { "instruction": "广义转录组和狭义转录组在定义上的主要区别是什么?", "input": "", "output":… See the full description on the dataset page: https://huggingface.co/datasets/DigitalIntelligenceCenter-of-ICMM/Baize-TCM-Corpus-for-Large-Language-Models-V3.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
2likes141downloads
Dataset Card

白泽中医药大模型语料库

版本:3.0 语料数量:157,438 条 语言:中文 领域:中医药(Traditional Chinese Medicine, TCM) 格式:问答对(QA Pair) 用途:中医药大模型训练、知识问答系统、语义理解研究


📚 简介

“白泽中医药大模型语料库”是一个专注于中医药领域的高质量问答语料集合,旨在支持中医药知识的数字化、智能化应用。语料库共包含 157,438 条 经过整理与校对的问答对,涵盖中医基础理论、中药学、方剂学、诊断学、针灸推拿、经典医籍、临床实践等多个子领域。

本语料库可广泛应用于:

  • —中医药大语言模型的预训练与微调
  • —智能问答系统开发
  • —医学自然语言处理任务(如实体识别、关系抽取)
  • —中医药知识图谱构建

🧩 数据内容

每条语料为一个标准的问答对,格式如下:

json
{
    "instruction": "广义转录组和狭义转录组在定义上的主要区别是什么?",
    "input": "",
    "output": "广义转录组是指从一种细胞或组织的基因组所转录出来的所有RNA的总和,包括编码蛋白质的信使RNA(mRNA)以及各种非编码RNA(ncRNA)。而狭义转录组则特指细胞在特定时间点上,编码蛋白质的基因所对应的mRNA分子的集合,不包含非编码RNA。因此,两者在定义上的主要区别在于涵盖范围的不同:广义转录组包含所有类型的转录产物,既包括mRNA也包括ncRNA,反映的是基因组整体的转录活动;而狭义转录组仅聚焦于能够指导蛋白质合成的mRNA部分,代表的是蛋白质编码基因的转录状态。",
    "system": ""
  }