daoism
Datasets
All datasets matching “daoism”daoism-knowledge-rag
Daoism Knowledge RAG
鼎稔道學館(Dingren Daoxue Lab)館藏知識庫——專為 RAG(Retrieval-Augmented Generation)優化的道教知識結構化資料集,95,919 條目。
Overview
This dataset is the curated knowledge base behind Dingren Daoxue Lab (鼎稔道學館), released under Apache 2.0 to enable open-source RAG with the Daoism-Qwen3.5-9B model.
It covers eight categories of Daoist knowledge:
Type
Count
Content
concept
~32,700
神學概念、宇宙論、修煉名相
scripture
~23,000
經文、戒律、科儀文獻
deity
~12,000
神祇、仙真、神格體系
ritual
~11,000… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/daoism-knowledge-rag.Daoism-QA-Eval-v1
Daoism-QA-Eval-v1
Benchmark Evaluation Set for Daoism-Qwen3.5-9B and other LLMs on Daoist knowledge tasks.
由鼎稔道學館(lius.cc)發布。本 eval set 是 Daoism-QA-5K v0.1 中經 stratified sampling 抽出的 120 題 hold-out 集,永久切出不再用於任何 SFT 訓練。
完整評測方法論見本 repo 的 methodology.md 與 evaluator_prompt_v1.md。
規格
項目
值
樣本數
120
抽樣方式
Stratified(5 task_type × 24 題)
分層
每類依 groundedness_score 取 top/mid/bottom 1/3 各 8 題
來源
Daoism-QA-5K v0.1(249 條 pilot)
切出狀態
Hold-out,永久不再用於 SFT 訓練
語言
繁體中文… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/Daoism-QA-Eval-v1.Daoism-Wiki-QA-280K
Daoism-Wiki-QA-280K
規模型道教問答資料集——263,910 條從鼎稔道學館 wiki 與論文庫批量蒸餾、經 critic_score ≥ 93 嚴格篩選後的高品質 QA pairs。
由鼎稔道學館(lius.cc)發布。本資料集與 Daoism-QA-5K(grounded 精選子集)形成「規模 × 精度」雙資產,配合 Daoism-Qwen3.5-9B 開源道教 LLM 完成「模型 + 資料」全棧開源。
規格
項目
值
樣本數
263,910
篩選門檻
critic_score >= 93
來源規模
578,174 raw → 263,910 final(保留率 45.6%)
平均 critic_score
~95.8
滿分 (100) 樣本
41,830(15.9%)
95-99 分樣本
174,006(65.9%)
93-94 分樣本
48,074(18.2%)
語言
繁體中文(zh-Hant)
檔案大小
240 MB
重複去除
4,769 條(依… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/Daoism-Wiki-QA-280K.daoism-sft-v1
Daoism SFT Dataset v1
道教 LLM SFT 訓練資料集 — Phase 1-2 蒸餾+清洗產物。配 Qwen3.6-27B QLoRA 微調用。
資料來源
從 lius-cc 道教知識庫(vault: concept/deity/scripture/ritual/paper/person)蒸餾。生成模型:
ChatGPT gpt-5.5-mini(主力)
Gemini 2.5 Fast / Flash(多源整合)
Pipeline
Phase 1 蒸餾:vault → instruction/response pair(578k raw)
Phase 2 清洗:
critic_score ≥ 80 過濾
長度過濾(instr ≥10 字、resp 80-2000 字)
精確去重 + 語意去重(gemini-embedding-2, cos < 0.97)
紅線檢查(醫療/命名/墓地/法事金額)→ 加 disclaimer
邊緣 pair 改寫(80-85 → 90+ via… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/daoism-sft-v1.daoism-rag-sft-v1
Daoism RAG-Aware SFT Dataset v1
每個 pair 都帶 retrieved context(2 份道教文獻),訓練 LLM 學會「看上下文回答」。
格式
{
"instruction": "以下是相關的道教文獻:\n【文件 A:...】\n... \n【文件 B:...】\n...\n\n問題:請說明...",
"input": "",
"output": "..."
}
規模
Train: 344455
Val: 18129
總計: 362584
用途
訓練 LLM 走 RAG-SaaS 場景。部署到「客戶丟自己道教資料庫 + 用戶問題」這種 production 工作流時,比純 SFT model 準確率高 30%+。
License
CC-BY-NC-SA 4.0
daoism
