CoolFace
Datasetpublic

victcn/chinese-data-quality

数据 中文数据集用的是 C4-zh 的前10w数据,用 Qwen2.5-32B-Instruct-AWQ(48G单卡)进行了 Low / Mid / High 的打分,打分用的是英文数据集用的是现有的英文数据集 text-score-data。最后整合为了20w的数据集, 用bert-base-chinese微调了模型,地址为chinese_data_quality_score。

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes11downloads
Dataset Card

数据

中文数据集用的是 C4-zh 的前10w数据,用 Qwen2.5-32B-Instruct-AWQ(48G单卡)进行了 Low / Mid / High 的打分,打分用的是英文数据集用的是现有的英文数据集 text-score-data。最后整合为了20w的数据集,

用bert-base-chinese微调了模型,地址为chinese_data_quality_score