senry5433/china-effective-laws-regulations
全国现行法律法规合集 现行有效的中华人民共和国法律、行政法规、监察法规、地方性法规、司法解释结构化文本。一部法规一行,一条法条一行,供查阅、检索、RAG 和法律 NLP 使用。 数据来自全国人大常委会办公厅 国家法律法规数据库,下载口径为官网的 「有效及尚未生效」。正文由 Word 原文用脚本抽取,未经大模型改写。 这不是官方汇编,不能替代公报或标准文本,也不能作为法律意见。 电子文本与标准文本不一致时,以法律规定的标准文本为准。 快照日期:2026-08-26 效力说明 本数据集 以现行有效法律法规为主体: 效力 status 法规份数 说明 有效 17,649 现行有效,默认应使用这一部分 尚未生效 7 已公布、施行日晚于快照日 失效 45 文件名含「失效」,多为已到期的全国人大常委会试点授权决定 使用时请筛选 status == "有效",即可得到现行有效文本。同一部法若有修正前后多个版本,均予保留,用 filename_date 区分,采用最新日期即可。… See the full description on the dataset page: https://huggingface.co/datasets/senry5433/china-effective-laws-regulations.
全国现行法律法规合集
现行有效的中华人民共和国法律、行政法规、监察法规、地方性法规、司法解释结构化文本。一部法规一行,一条法条一行,供查阅、检索、RAG 和法律 NLP 使用。
数据来自全国人大常委会办公厅 国家法律法规数据库,下载口径为官网的 「有效及尚未生效」。正文由 Word 原文用脚本抽取,未经大模型改写。
这不是官方汇编,不能替代公报或标准文本,也不能作为法律意见。 电子文本与标准文本不一致时,以法律规定的标准文本为准。
快照日期:2026-08-26
效力说明
本数据集 以现行有效法律法规为主体:
使用时请筛选 status == "有效",即可得到现行有效文本。同一部法若有修正前后多个版本,均予保留,用 filename_date 区分,采用最新日期即可。
不含部门规章、地方政府规章(那些在国家规章库,不在本源范围)。
目录
法规分类
两个粒度:
- `documents`(默认):一部法规一行,字段
text为全文 - `articles`:一条「第X条」一行,带所属法规、章、节。决定、批复、答复等没有「第X条」结构的,只出现在
documents(1,131 份)
仓库文件
README.md 本说明(dataset card)
data/
documents/
法律.parquet
行政法规.parquet
监察法规.parquet
地方法规.parquet
司法解释.parquet
articles/
法律.parquet
行政法规.parquet
监察法规.parquet
地方法规.parquet
司法解释.parquet加载时按 config 选择,不必一次下载全部。只要全国法律,用 "法律" 即可。
使用方法
Hub 上没有 train/test 切分,全量放在 train。把下面的 REPO_ID 换成 senry5433/china-effective-laws-regulations(上传后)或本地目录。
1. 加载全文(现行有效)
from datasets import load_dataset
REPO_ID = "senry5433/china-effective-laws-regulations"
docs = load_dataset(REPO_ID, "documents", split="train")
docs = docs.filter(lambda r: r["status"] == "有效")
print(len(docs), docs[0]["title"])
print(docs[0]["text"][:300])2. 按条加载(适合 RAG / 向量库)
arts = load_dataset(REPO_ID, "articles", split="train")
arts = arts.filter(lambda r: r["status"] == "有效")
# 写入检索库时建议带上法规名和条号
record = arts[0]
chunk = f"《{record['title']}》{record['article_no_cn']} {record['text']}"3. 只要某一类
laws = load_dataset(REPO_ID, "法律", split="train") # 仅法律全文
admin = load_dataset(REPO_ID, "行政法规", split="train")
local = load_dataset(REPO_ID, "地方法规", split="train")
judicial = load_dataset(REPO_ID, "司法解释", split="train")
supervision = load_dataset(REPO_ID, "监察法规", split="train")
# 条级按分类过滤
arts = load_dataset(REPO_ID, "articles", split="train")
criminal_proc = arts.filter(
lambda r: r["category"] == "法律" and "刑事诉讼法" in r["title"]
)4. 按标题取最新文本
docs = load_dataset(REPO_ID, "documents", split="train")
docs = docs.filter(lambda r: r["status"] == "有效")
def latest_by_title(ds, title):
rows = [r for r in ds if r["title"] == title]
rows.sort(key=lambda r: r["filename_date"] or "", reverse=True)
return rows[0] if rows else None
cyber = latest_by_title(docs, "中华人民共和国网络安全法")
print(cyber["filename_date"], cyber["n_articles"])5. 本地尚未上传时
from datasets import load_dataset
root = "/Users/senrylee/Documents/编程/2.成果/claude/全国法律法规-HF数据集"
docs = load_dataset(root, "documents", split="train")
arts = load_dataset(root, "articles", split="train")或直接读 Parquet:
import pandas as pd
df = pd.read_parquet("data/documents/法律.parquet")
df = df[df["status"] == "有效"]字段
documents(一部法规一行)
articles(一条一行)
许可与引用
法律、法规及官方正式译文不适用《著作权法》第五条。本快照以 CC0 1.0 放弃汇编权利。
引用时请同时注明:
- 本数据集
senry5433/china-effective-laws-regulations - 国家法律法规数据库 https://flk.npc.gov.cn/
- 快照日期 2026-08-26
已知局限
- 效力以文件名和施行日期规则标注,不替代官方效力检索
- 约 1,672 份文件名没有日期
- 约 3,333 份为老
.doc,由 macOStextutil抽取 - 127 份地方法规标题不以规范省/市开头,
jurisdiction可能为空 - 切条依赖「第X条」起段,少数排版异常可能漏切或误切
- 官网持续更新,本仓库是 2026-08-26 快照,不自动同步新法
