OysterCoreAI/SFT-General-Simplified.Chinese-10K
SFT-General-Simplified.Chinese-10K 概况介绍 Hugging Face仓库名称:OysterCoreAI/SFT-General-Simplified.Chinese-10K SFT-General-Simplified.Chinese-10K 是一个面向简体中文监督微调(SFT)研究的指令—回答数据集,针对数据源以及数据质量做出了严格把控和筛选(通过信息密度、上下文长度等共计12维度筛选),共 10,050 条记录。内容从中文维基百科开放转储的一手条目中提取并进行规则化任务构造;没有使用 Belle、MOSS-SFT、Alpaca-Chinese 或其他既有 SFT/指令数据集作为数据源。 重要边界: 本数据集通过自动清洗、三层次筛选、定向数据收集、双逻辑 18 维评分和独立发布审计。自动分数是筛选指标,并非事实正确率、法律意见或模型效果保证。高风险场景使用前请另行人工复核。 训练集数据概览 项目 结果 记录数 10,050 语言 中文(简体规范化目标)… See the full description on the dataset page: https://huggingface.co/datasets/OysterCoreAI/SFT-General-Simplified.Chinese-10K.
Update README.md
Update README.md
Upload 2 files
Delete SHA256SUMS
Delete README.md
Upload 13 files
Delete README.md
Delete NOTICE.md
Delete LICENSE
Delete DATASET_SCHEMA.json
Delete CHANGELOG.md
Delete .gitattributes
Delete SHA256SUMS
Delete quality
Delete data
Upload 2 files
Upload 6 files
Upload SHA256SUMS
Upload NOTICE.md
Upload LICENSE
Delete sft-general-zh-10k
Upload .gitattributes
Delete .gitattributes
Update README.md
Update README.md
Update README.md
Upload README.md
Delete README.md
Release the first version of the General Simplified-Chinese SFT Dataset
initial commit
