lius-cc/daoism-sft-v1
Daoism SFT Dataset v1 道教 LLM SFT 訓練資料集 — Phase 1-2 蒸餾+清洗產物。配 Qwen3.6-27B QLoRA 微調用。 資料來源 從 lius-cc 道教知識庫(vault: concept/deity/scripture/ritual/paper/person)蒸餾。生成模型: ChatGPT gpt-5.5-mini(主力) Gemini 2.5 Fast / Flash(多源整合) Pipeline Phase 1 蒸餾:vault → instruction/response pair(578k raw) Phase 2 清洗: critic_score ≥ 80 過濾 長度過濾(instr ≥10 字、resp 80-2000 字) 精確去重 + 語意去重(gemini-embedding-2, cos < 0.97) 紅線檢查(醫療/命名/墓地/法事金額)→ 加 disclaimer 邊緣 pair 改寫(80-85 → 90+… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/daoism-sft-v1.
Daoism SFT Dataset v1
道教 LLM SFT 訓練資料集 — Phase 1-2 蒸餾+清洗產物。配 Qwen3.6-27B QLoRA 微調用。
資料來源
從 lius-cc 道教知識庫(vault: concept/deity/scripture/ritual/paper/person)蒸餾。生成模型:
- ChatGPT gpt-5.5-mini(主力)
- Gemini 2.5 Fast / Flash(多源整合)
Pipeline
- Phase 1 蒸餾:vault → instruction/response pair(578k raw)
- Phase 2 清洗:
- critic_score ≥ 80 過濾
- 長度過濾(instr ≥10 字、resp 80-2000 字)
- 精確去重 + 語意去重(gemini-embedding-2, cos < 0.97)
- 紅線檢查(醫療/命名/墓地/法事金額)→ 加 disclaimer
- 邊緣 pair 改寫(80-85 → 90+ via flash-lite)
目標 base model
Qwen3.6-27B(原生 MTP heads,推理 2-3x 加速)。
格式
alpaca/: Alpaca format(axolotl 默認)sharegpt/: ShareGPT format(llamafactory 推薦)
Stats
- Total: 381667
- Train: 362584
- Val: 19083 (5%)
Disclaimer
僅供學術研究與 LLM 微調用途。任何道教實務(科儀、命理、法事)請諮詢專業道長。
License
CC-BY-NC-SA 4.0
