datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
RFP_Categorizationchina-rd-expenditure-categorization-dataset
Summary
本数据集用于 企业所得税研发费用 凭证文本的预分类/归集建议任务:给定费用凭证的简要信息(科目/摘要/部门/金额/收款方等),输出结构化预分析结果,供下游规则引擎与人工复核使用。
当前仓库包含两份 JSONL:
**data/train_samples.jsonl**:人工/示例样本(相对少量)
**data/train_generated.jsonl**:模型生成的扩充样本(相对多量),每条带 generated: true
Data format
每行是一个 JSON 对象,核心字段如下:
**messages**:对话格式(system/user/assistant)
system:任务说明与输出字段规范
user:一条费用凭证的文本化输入
assistant:只输出合法 JSON 字符串(结构化预分类结果)
**category**:该样本的归集科目标签(用于训练/评估的外部标签)
**difficulty**:难度(简单/中等/困难)
**generated**:是否为生成数据(仅在生成集里出现,布尔)… See the full description on the dataset page: https://huggingface.co/datasets/guannanjiayou/china-rd-expenditure-categorization-dataset.categorizationcategorization_unlearnwebsite-categorization-dataset
