CoolFace
Datasetpublic

liushuaiqian/Chinese-High-School-Chemistry-Correction-Dataset

Chinese-High-School-Chemistry-Correction-Dataset 一个面向「高中化学垂直大模型微调」的中文问答与文本生成数据集 1. 数据集缘起 为了训练一个高中化学领域的垂直大模型,我们需要大量高质量、结构化的中文语料。本数据集整理了三版主流教科书、常考化学方程式与畅销教辅等中的知识点,全部转为统一的 JSONL 格式。 2. 数据来源 普通高中教科书(苏教版、人教版、鲁教版)、高中常考化学方程式、高中参考教辅资料(一本涂书、教材帮等)均转成jsonl格式 该jsonl文件数据,部分行或许有格式错误,需要自行编写py脚本校对,以便用于大模型微调。 3. 数据格式(JSONL) 每行一条记录,可直接用于 Hugging Face datasets 库: {"instruction": "已知0.5 mol的水(H₂O)的质量是9 g,且含有3.01×10²³个水分子。请计算1 mol水的质量和阿伏伽德罗常数。"… See the full description on the dataset page: https://huggingface.co/datasets/liushuaiqian/Chinese-High-School-Chemistry-Correction-Dataset.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
4likes297downloads
Dataset Card

Chinese-High-School-Chemistry-Correction-Dataset

一个面向「高中化学垂直大模型微调」的中文问答与文本生成数据集


1. 数据集缘起

为了训练一个高中化学领域的垂直大模型,我们需要大量高质量、结构化的中文语料。 本数据集整理了三版主流教科书、常考化学方程式与畅销教辅等中的知识点,全部转为统一的 JSONL 格式。


2. 数据来源

普通高中教科书(苏教版、人教版、鲁教版)、高中常考化学方程式、高中参考教辅资料(一本涂书、教材帮等)均转成jsonl格式

该jsonl文件数据,部分行或许有格式错误,需要自行编写py脚本校对,以便用于大模型微调。

3. 数据格式(JSONL)

每行一条记录,可直接用于 Hugging Face `datasets` 库:

json
{"instruction": "已知0.5 mol的水(H₂O)的质量是9 g,且含有3.01×10²³个水分子。请计算1 mol水的质量和阿伏伽德罗常数。", "output": "首先,我们知道0.5 mol水的质量是9 g,因此1 mol水的质量可以通过比例计算得到:\\[ ext{1 mol水的质量} = rac{9 ext{ g}}{0.5 ext{ mol}} = 18 ext{ g/mol} \\]其次,0.5 mol水含有3.01×10²³个水分子,那么1 mol水含有的水分子数为:\\[ ext{1 mol水含有的水分子数} = rac{3.01 imes 10^{23}}{0.5} = 6.02 imes 10^{23} \\]这个数值即为阿伏伽德罗常数。综上所述,1 mol水的质量是18 g/mol,阿伏伽德罗常数为6.02×10²³个/mol。"}