CoolFace
Apppublic

duqing026/corpus-curator-agent

sourceHugging Faceupdated 7mo agoView on Hugging Face
0likes
App README

语料策展人 (Corpus Curator Agent)

项目简介 (Project Overview)

语料策展人 是一个专注于 LLM 训练数据工程 的智能代理。它扮演着“数据炼金术士”的角色,能够将非结构化的原始文本(Raw Text)自动提炼为高质量的 指令微调数据集 (Instruction Tuning Datasets)

本项目旨在解决大模型训练中“高质量数据匮乏”的痛点,通过 AI 自动化流程,将混乱的信息转化为高价值的数字资产。

核心功能 (Key Features)

  1. 1.智能数据提炼 (AI Refinery):
  2. 2.集成 SiliconFlow API (DeepSeek/Qwen),自动从原始文本中提取逻辑清晰的 Instruction-Input-Output 对。
  3. 3.支持 Alpaca 和 ShareGPT 两种主流微调格式。
  1. 1.质量评估 (Quality Scoring):
  2. 2.内置数据质量评分机制,可视化展示语料的价值分布。
  1. 1.资产积累 (Asset Vault):
  2. 2.本地化存储提炼后的数据集 (SQLite),形成可复用的企业级语料资产库。
  3. 3.支持一键导出 .jsonl 格式,直接用于 LLaMA-Factory 等框架进行训练。
  1. 1.可视化仪表盘 (Dashboard):
  2. 2.实时监控语料生产进度和质量分布 (ECharts)。

技术栈 (Tech Stack)

  • Frontend: Vue.js 3, Tailwind CSS, ECharts (Responsive & Mobile-First)
  • Backend: Flask (Python 3.11), SQLite
  • AI Engine: SiliconFlow API (DeepSeek-V3 / Qwen 2.5)
  • Deployment: Docker / Hugging Face Spaces

快速开始 (Quick Start)

本地运行

bash
# 1. 克隆项目
git clone https://github.com/your-repo/corpus-curator-agent.git
cd corpus-curator-agent

# 2. 安装依赖
pip install -r requirements.txt

# 3. 运行应用
python app.py

访问: http://localhost:7860

Docker 运行

bash
docker build -t corpus-curator .
docker run -p 7860:7860 corpus-curator

商业价值 (Commercial Value)

  • 数据即资产: 随着 LLM 的普及,高质量的垂直领域微调数据(SFT Data)是企业最核心的壁垒。
  • 降本增效: 替代昂贵的人工标注团队,将数据清洗成本降低 90%。
  • 基础设施: 作为 LLM 产业链的上游工具(卖铲子的人),具有极强的通用性和市场需求。

许可证 (License)

MIT