CoolFace
Datasetpublic

lius-cc/daoism-sft-v1

Daoism SFT Dataset v1 道教 LLM SFT 訓練資料集 — Phase 1-2 蒸餾+清洗產物。配 Qwen3.6-27B QLoRA 微調用。 資料來源 從 lius-cc 道教知識庫(vault: concept/deity/scripture/ritual/paper/person)蒸餾。生成模型: ChatGPT gpt-5.5-mini(主力) Gemini 2.5 Fast / Flash(多源整合) Pipeline Phase 1 蒸餾:vault → instruction/response pair(578k raw) Phase 2 清洗: critic_score ≥ 80 過濾 長度過濾(instr ≥10 字、resp 80-2000 字) 精確去重 + 語意去重(gemini-embedding-2, cos < 0.97) 紅線檢查(醫療/命名/墓地/法事金額)→ 加 disclaimer 邊緣 pair 改寫(80-85 → 90+… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/daoism-sft-v1.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes17downloads
Dataset Card

Daoism SFT Dataset v1

道教 LLM SFT 訓練資料集 — Phase 1-2 蒸餾+清洗產物。配 Qwen3.6-27B QLoRA 微調用。

資料來源

從 lius-cc 道教知識庫(vault: concept/deity/scripture/ritual/paper/person)蒸餾。生成模型:

  • —ChatGPT gpt-5.5-mini(主力)
  • —Gemini 2.5 Fast / Flash(多源整合)

Pipeline

  1. 1.Phase 1 蒸餾:vault → instruction/response pair(578k raw)
  2. 2.Phase 2 清洗:
  3. 3.critic_score ≥ 80 過濾
  4. 4.長度過濾(instr ≥10 字、resp 80-2000 字)
  5. 5.精確去重 + 語意去重(gemini-embedding-2, cos < 0.97)
  6. 6.紅線檢查(醫療/命名/墓地/法事金額)→ 加 disclaimer
  7. 7.邊緣 pair 改寫(80-85 → 90+ via flash-lite)

目標 base model

Qwen3.6-27B(原生 MTP heads,推理 2-3x 加速)。

格式

  • —alpaca/: Alpaca format(axolotl 默認)
  • —sharegpt/: ShareGPT format(llamafactory 推薦)

Stats

  • —Total: 381667
  • —Train: 362584
  • —Val: 19083 (5%)

Disclaimer

僅供學術研究與 LLM 微調用途。任何道教實務(科儀、命理、法事)請諮詢專業道長。

License

CC-BY-NC-SA 4.0