CoolFace
Datasetpublic

ysober/zh_spec_eval

中文专项评测集 本评测集共包含 512 条样本,分为 4 个工作负载(workload),每个工作负载包含 128 条样本。数据文件位于当前目录。 数据概览 Workload 来源数据集 数据划分 采样方法 Prompt 长度中位数(token) zh_ceval ceval/ceval-exam val 汇总全部 52 个学科的样本,使用随机种子 0 打乱后取前 128 条,以兼顾学科覆盖的均衡性 96 zh_gaokao_math hails/agieval-gaokao-mathqa test(351 条) 使用随机种子 0 打乱后取前 128 条 142 zh_simpleqa OpenStellarTeam/Chinese-SimpleQA train(3,000 条) 使用随机种子 0 打乱后取前 128 条 30 zh_alpaca_gpt4 llm-wizard/alpaca-gpt4-data-zh train(48,818 条) 过滤掉 instruction 少于… See the full description on the dataset page: https://huggingface.co/datasets/ysober/zh_spec_eval.

sourceHugging Faceupdated 29d agoView on Hugging Face
0likes106downloads
Dataset Card

中文专项评测集

本评测集共包含 512 条样本,分为 4 个工作负载(workload),每个工作负载包含 128 条样本。数据文件位于当前目录。

数据概览

Workload来源数据集数据划分采样方法Prompt 长度中位数(token)
zh_cevalceval/ceval-examval汇总全部 52 个学科的样本,使用随机种子 0 打乱后取前 128 条,以兼顾学科覆盖的均衡性96
zh_gaokao_mathhails/agieval-gaokao-mathqatest(351 条)使用随机种子 0 打乱后取前 128 条142
zh_simpleqaOpenStellarTeam/Chinese-SimpleQAtrain(3,000 条)使用随机种子 0 打乱后取前 128 条30
zh_alpaca_gpt4llm-wizard/alpaca-gpt4-data-zhtrain(48,818 条)过滤掉 instruction 少于 12 个字符的样本,使用随机种子 0 打乱后取前 128 条10

选型说明

这 4 个工作负载覆盖了中文生成任务的四种典型形态:学科知识与推理(C-Eval)、较长的数学推理(高考数学)、短答案事实问答(SimpleQA),以及开放式指令写作(Alpaca-zh)。整体结构与 RadixArk 英文评测套件中的代码、数学和开放对话任务相近,但所有数据均为原生中文。