tttonyyy/NuminaMath-CoT-cn_k12-20000-old
本数据集为NuminaMath-CoT在cn_k12类别下前20000条数据中进行的长CoT文本生成尝试。 里面有两个数据文件,completion.jsonl和distilled.jsonl。 其中,completion.jsonl是gemma2-27b-it生成的数据,因为gemma2-27b-it最后得到的结果可能提取不出\boxed{}里面的内容等因素,所以最后生成了约18.6k的数据。 而distilled.jsonl是基于上面的回答成功的问题,使用DeepSeek-R1-Distill-Qwen-32B生成的数据(其实不应该这样,之后有机会再从20000条里面直接生成)。 因为NuminaMath-CoT的cn_k12数据大多是一些综合应用题,一条数据中会有多个子问题,回答的时候也要分别回答。对问题回答的答案进行验证较难,尚未进行答案验证,需要下载下来之后再进行更精细化的处理。 completion.jsonl中的数据标签描述: source (String):数据来源类别,为原始标签 problem (String):数学问题文本,为原始标签 solution… See the full description on the dataset page: https://huggingface.co/datasets/tttonyyy/NuminaMath-CoT-cn_k12-20000-old.
本数据集为NuminaMath-CoT在cn_k12类别下前20000条数据中进行的长CoT文本生成尝试。
里面有两个数据文件,completion.jsonl和distilled.jsonl。
其中,completion.jsonl是gemma2-27b-it生成的数据,因为gemma2-27b-it最后得到的结果可能提取不出\boxed{}里面的内容等因素,所以最后生成了约18.6k的数据。
而distilled.jsonl是基于上面的回答成功的问题,使用DeepSeek-R1-Distill-Qwen-32B生成的数据(其实不应该这样,之后有机会再从20000条里面直接生成)。
因为NuminaMath-CoT的cn_k12数据大多是一些综合应用题,一条数据中会有多个子问题,回答的时候也要分别回答。对问题回答的答案进行验证较难,尚未进行答案验证,需要下载下来之后再进行更精细化的处理。
completion.jsonl中的数据标签描述:
- source (String):数据来源类别,为原始标签
- problem (String):数学问题文本,为原始标签
- solution (String):解答过程,经过GPT-4o的重写,为原始标签
- messages (List):组合完毕的提问与解答模板,为原始标签
- n_solutions (List):从原始标签中采样得到的n种解答
- fromnto_k (String):评价n种解答,并从中选最有代表性的k中解答
- kdiffsolutions (List):被选出来的k种解答
- consistency_evaluation (String):评价k种解答,如果答案不一致,评价哪个解答最可靠
- conclusion (String):根据上面所有步骤进行总结,给出一个最终的解答
- pred_result (String):第一次出现在\boxed{}中的解答
- new_messages (List):基于上面的多样解答和评价来生成的模板数据,可以快速使用
distilled.jsonl中的数据标签描述:
- idx (int):数据来源类别,为原始标签
- pred_cot (String):DeepSeek-R1-Distill-Qwen-32B针对question标签内容的回复文本
- pred (String):从predcot中初步提取的解答。一般是最后一个\boxed{}内部的答案,如果回答没有\boxed{},那么就是predcot中出现的最后一个数字
- report (String):全是None,不用管
- question (String):对应
completion.jsonl中的problem标签 - newmessages (String):基于question和predcot标签来生成的模板数据,可以快速使用
