CoolFace
Datasetpublic

noah248/chinese-legal-sft

Chinese Legal SFT Dataset(中文法律 SFT 数据集) 面向大模型监督微调(SFT)的中文法律问答数据集,共 19,332 条问答对, 每条附带 LLM 质量评分。覆盖数据采集 → 清洗 → 去重 → 质量过滤 → 格式化 → 质量打分的完整数据工程流程。 配套代码与完整流水线:https://github.com/noah-white-python/legal-sft-dataset 数据构建流程 冷启动:基于开源数据集 DISC-Law-SFT 整理。 清洗:NFKC 全角半角统一、去控制字符、去空白、缺失过滤。 去重:精确去重(MD5)+ MinHash + LSH 近似去重(阈值 0.8)。 质量过滤:长度、中文字符占比等启发式规则,有效率 96.7%(20,000 → 19,332)。 格式化:输出标准 Alpaca 指令格式。 质量打分:用 LLM-as-judge 对全部数据从复杂度、清晰度、信息量三维度打分(1-5 分)。 字段说明… See the full description on the dataset page: https://huggingface.co/datasets/noah248/chinese-legal-sft.

sourceHugging Facecc-by-nc-4.0updated 3mo agoView on Hugging Face
0likes140downloads
Dataset Card

Chinese Legal SFT Dataset(中文法律 SFT 数据集)

面向大模型监督微调(SFT)的中文法律问答数据集,共 19,332 条问答对, 每条附带 LLM 质量评分。覆盖数据采集 → 清洗 → 去重 → 质量过滤 → 格式化 → 质量打分的完整数据工程流程。

配套代码与完整流水线:https://github.com/noah-white-python/legal-sft-dataset

数据构建流程

  1. 1.冷启动:基于开源数据集 DISC-Law-SFT 整理。
  2. 2.清洗:NFKC 全角半角统一、去控制字符、去空白、缺失过滤。
  3. 3.去重:精确去重(MD5)+ MinHash + LSH 近似去重(阈值 0.8)。
  4. 4.质量过滤:长度、中文字符占比等启发式规则,有效率 96.7%(20,000 → 19,332)。
  5. 5.格式化:输出标准 Alpaca 指令格式。
  6. 6.质量打分:用 LLM-as-judge 对全部数据从复杂度、清晰度、信息量三维度打分(1-5 分)。

字段说明

字段说明
instruction法律问题
input补充信息(本数据集为空,符合 Alpaca 规范)
output法律解答
source数据来源
complexity / clarity / informativenessLLM 打分:复杂度 / 清晰度 / 信息量(1-5)

质量统计

维度平均分
复杂度 complexity2.89
清晰度 clarity4.12
信息量 informativeness3.82

综合分(三维平均)≥4 的高质量子集 5,904 条(30.5%),可用于优先训练。 平均问题长度 27 字,平均答案长度 432 字。

使用方法

python
from datasets import load_dataset

ds = load_dataset("noah248/chinese-legal-sft")
print(ds["train"][0])

# 仅取高质量子集
high = ds["train"].filter(
    lambda r: (r["complexity"] + r["clarity"] + r["informativeness"]) / 3 >= 4
)

许可与免责

  • —本数据集仅供学习与研究使用,不用于商业用途。
  • —数据基于开源数据集整理,法律内容仅供参考,不构成法律意见。
  • —原始数据版权归各来源所有。