duqing026/corpus-curator-agent
0
语料策展人 (Corpus Curator Agent)
项目简介 (Project Overview)
语料策展人 是一个专注于 LLM 训练数据工程 的智能代理。它扮演着“数据炼金术士”的角色,能够将非结构化的原始文本(Raw Text)自动提炼为高质量的 指令微调数据集 (Instruction Tuning Datasets)。
本项目旨在解决大模型训练中“高质量数据匮乏”的痛点,通过 AI 自动化流程,将混乱的信息转化为高价值的数字资产。
核心功能 (Key Features)
- 智能数据提炼 (AI Refinery):
- 集成 SiliconFlow API (DeepSeek/Qwen),自动从原始文本中提取逻辑清晰的 Instruction-Input-Output 对。
- 支持 Alpaca 和 ShareGPT 两种主流微调格式。
- 质量评估 (Quality Scoring):
- 内置数据质量评分机制,可视化展示语料的价值分布。
- 资产积累 (Asset Vault):
- 本地化存储提炼后的数据集 (SQLite),形成可复用的企业级语料资产库。
- 支持一键导出
.jsonl格式,直接用于 LLaMA-Factory 等框架进行训练。
- 可视化仪表盘 (Dashboard):
- 实时监控语料生产进度和质量分布 (ECharts)。
技术栈 (Tech Stack)
- Frontend: Vue.js 3, Tailwind CSS, ECharts (Responsive & Mobile-First)
- Backend: Flask (Python 3.11), SQLite
- AI Engine: SiliconFlow API (DeepSeek-V3 / Qwen 2.5)
- Deployment: Docker / Hugging Face Spaces
快速开始 (Quick Start)
本地运行
# 1. 克隆项目
git clone https://github.com/your-repo/corpus-curator-agent.git
cd corpus-curator-agent
# 2. 安装依赖
pip install -r requirements.txt
# 3. 运行应用
python app.py访问: http://localhost:7860
Docker 运行
docker build -t corpus-curator .
docker run -p 7860:7860 corpus-curator商业价值 (Commercial Value)
- 数据即资产: 随着 LLM 的普及,高质量的垂直领域微调数据(SFT Data)是企业最核心的壁垒。
- 降本增效: 替代昂贵的人工标注团队,将数据清洗成本降低 90%。
- 基础设施: 作为 LLM 产业链的上游工具(卖铲子的人),具有极强的通用性和市场需求。
许可证 (License)
MIT
