lius-cc/Daoism-QA-Eval-v1
Daoism-QA-Eval-v1 Benchmark Evaluation Set for Daoism-Qwen3.5-9B and other LLMs on Daoist knowledge tasks. 由鼎稔道學館(lius.cc)發布。本 eval set 是 Daoism-QA-5K v0.1 中經 stratified sampling 抽出的 120 題 hold-out 集,永久切出不再用於任何 SFT 訓練。 完整評測方法論見本 repo 的 methodology.md 與 evaluator_prompt_v1.md。 規格 項目 值 樣本數 120 抽樣方式 Stratified(5 task_type × 24 題) 分層 每類依 groundedness_score 取 top/mid/bottom 1/3 各 8 題 來源 Daoism-QA-5K v0.1(249 條 pilot) 切出狀態 Hold-out,永久不再用於 SFT 訓練 語言… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/Daoism-QA-Eval-v1.
Daoism-QA-Eval-v1
Benchmark Evaluation Set for Daoism-Qwen3.5-9B and other LLMs on Daoist knowledge tasks.
由鼎稔道學館(lius.cc)發布。本 eval set 是 Daoism-QA-5K v0.1 中經 stratified sampling 抽出的 120 題 hold-out 集,永久切出不再用於任何 SFT 訓練。
完整評測方法論見本 repo 的 `methodology.md` 與 `evaluator_prompt_v1.md`。
規格
Task Type 分布
資料結構
{
"eval_id": "eval_v1_<uuid>",
"source_id": "<原 Daoism-QA-5K uuid>",
"task_type": "qa|ritual_exegesis|term_disambiguation|procedure|source_comparison",
"strata": "<task_type>_<top|mid|bot>",
"question": "...",
"intent": "...",
"reference_answer": "<grounded 參考答案>",
"reference_claims": [{"claim": "...", "evidence_ids": ["e1"]}],
"reference_sources": [{"evidence_id": "e1", "doc_id": "...", "quote": "...", "url": "..."}],
"reference_tradition": ["zhengyi", "quanzhen", ...],
"reference_groundedness": 0.92,
"reference_confidence": 0.88
}使用方式
from datasets import load_dataset
ds = load_dataset("lius-cc/Daoism-QA-Eval-v1", split="test")
print(f"Eval set size: {len(ds)}")
print(ds[0])評測流程
- Generate candidate responses:對 120 題每題用你的 candidate 模型產出回答
- Run evaluator:依 `evaluator_prompt_v1.md` 用 Claude Opus 4.7(或同等強度 judge)對每題每 model 評分
- Aggregate metrics:依 task_type / 整體計算 mean total / per-dimension mean / pass rate / win rate
- Publish report:可選擇上傳到
lius-cc/Daoism-Benchmark-Results-v1(results dataset),方便對外引用
完整方法論見 methodology.md。
Evaluator Prompt
採 LLM-as-Judge + 抽樣人審雙軌。每題對每 model 評 4 維度 0-10 分:
每維度 0-10,總分 0-40。詳見 evaluator_prompt_v1.md。
Reproducibility 標準
第三方執行同一 evaluator prompt + 同 eval set,得到的評分應該可比較。本 repo 提供:
- 完整 eval set(120 題 + reference answers)
- 完整 evaluator prompt(system + user template)
- 評測 methodology(抽樣、評分、aggregation 全規格)
- 範例 invocation code
已知 Limitations
- LLM-as-Judge 偏差:用 Claude Opus 評分可能對特定文體有偏好。20 題人審用於校正,但 sample 數仍限。
- Reference 不是絕對真理:reference answer 由 GPT-5.5 + schema validation 產出,反映「主流學術共識」而非「絕對正確」。
- 單次抽樣:每題每 model 跑 1 次,未做 self-consistency 多次抽樣平均。
- 語言限定:繁體中文,未測簡體或英文表現。
詳見 methodology.md §7。
Roadmap
- ✅ v1.0(2026-05-24):120 題 + Methodology + Evaluator prompt
- 🔜 v1.1:加入 multi-judge ensemble(Opus + GPT-4o + DeepSeek-V3)
- 🔜 v2.0:eval set 擴增到 500-1,000 題
Citation
@dataset{daoism_qa_eval_v1_2026,
title = {Daoism-QA-Eval-v1: A Benchmark Evaluation Set for Daoist LLMs},
author = {Liu, Bruce (鼎稔道學館 / lius.cc)},
year = 2026,
month = may,
publisher = {Hugging Face},
version = {1.0},
url = {https://huggingface.co/datasets/lius-cc/Daoism-QA-Eval-v1},
}License
Related Assets
- Model under evaluation: lius-cc/Daoism-Qwen3.5-9B
- Source dataset: lius-cc/Daoism-QA-5K
- Large-scale SFT dataset: lius-cc/Daoism-Wiki-QA-280K
- Demo: https://demo.lius.cc
Contact
Bruce Liu / 鼎稔道學館
- Website: https://lius.cc
- LLM Demo: https://demo.lius.cc
- Email: chiyingliu@gmail.com
