CoolFace
Datasetpublic

lius-cc/Daoism-QA-Eval-v1

Daoism-QA-Eval-v1 Benchmark Evaluation Set for Daoism-Qwen3.5-9B and other LLMs on Daoist knowledge tasks. 由鼎稔道學館(lius.cc)發布。本 eval set 是 Daoism-QA-5K v0.1 中經 stratified sampling 抽出的 120 題 hold-out 集,永久切出不再用於任何 SFT 訓練。 完整評測方法論見本 repo 的 methodology.md 與 evaluator_prompt_v1.md。 規格 項目 值 樣本數 120 抽樣方式 Stratified(5 task_type × 24 題) 分層 每類依 groundedness_score 取 top/mid/bottom 1/3 各 8 題 來源 Daoism-QA-5K v0.1(249 條 pilot) 切出狀態 Hold-out,永久不再用於 SFT 訓練 語言… See the full description on the dataset page: https://huggingface.co/datasets/lius-cc/Daoism-QA-Eval-v1.

sourceHugging Facecc-by-sa-4.0updated 4mo agoView on Hugging Face
0likes19downloads
Dataset Card

Daoism-QA-Eval-v1

Benchmark Evaluation Set for Daoism-Qwen3.5-9B and other LLMs on Daoist knowledge tasks.

由鼎稔道學館(lius.cc)發布。本 eval set 是 Daoism-QA-5K v0.1 中經 stratified sampling 抽出的 120 題 hold-out 集,永久切出不再用於任何 SFT 訓練。

完整評測方法論見本 repo 的 `methodology.md` 與 `evaluator_prompt_v1.md`。

規格

項目值
樣本數120
抽樣方式Stratified(5 task_type × 24 題)
分層每類依 groundedness_score 取 top/mid/bottom 1/3 各 8 題
來源Daoism-QA-5K v0.1(249 條 pilot)
切出狀態Hold-out,永久不再用於 SFT 訓練
語言繁體中文
檔案大小2.2 MB

Task Type 分布

Task Type樣本數
term_disambiguation24
ritual_exegesis24
procedure24
source_comparison24
qa24

資料結構

json
{
  "eval_id": "eval_v1_<uuid>",
  "source_id": "<原 Daoism-QA-5K uuid>",
  "task_type": "qa|ritual_exegesis|term_disambiguation|procedure|source_comparison",
  "strata": "<task_type>_<top|mid|bot>",
  "question": "...",
  "intent": "...",
  "reference_answer": "<grounded 參考答案>",
  "reference_claims": [{"claim": "...", "evidence_ids": ["e1"]}],
  "reference_sources": [{"evidence_id": "e1", "doc_id": "...", "quote": "...", "url": "..."}],
  "reference_tradition": ["zhengyi", "quanzhen", ...],
  "reference_groundedness": 0.92,
  "reference_confidence": 0.88
}

使用方式

python
from datasets import load_dataset

ds = load_dataset("lius-cc/Daoism-QA-Eval-v1", split="test")
print(f"Eval set size: {len(ds)}")
print(ds[0])

評測流程

  1. 1.Generate candidate responses:對 120 題每題用你的 candidate 模型產出回答
  2. 2.Run evaluator:依 `evaluator_prompt_v1.md` 用 Claude Opus 4.7(或同等強度 judge)對每題每 model 評分
  3. 3.Aggregate metrics:依 task_type / 整體計算 mean total / per-dimension mean / pass rate / win rate
  4. 4.Publish report:可選擇上傳到 lius-cc/Daoism-Benchmark-Results-v1(results dataset),方便對外引用

完整方法論見 methodology.md。

Evaluator Prompt

採 LLM-as-Judge + 抽樣人審雙軌。每題對每 model 評 4 維度 0-10 分:

維度說明
accuracy事實正確性(與道教學術共識相符)
source_fidelity引用可追溯性(道藏 CT 編號、學者著作真實性)
coverage涵蓋度(核心面向是否完整回答)
clarity表達清晰度(術語、結構、繁體中文流暢度)

每維度 0-10,總分 0-40。詳見 evaluator_prompt_v1.md。

Reproducibility 標準

第三方執行同一 evaluator prompt + 同 eval set,得到的評分應該可比較。本 repo 提供:

  • —完整 eval set(120 題 + reference answers)
  • —完整 evaluator prompt(system + user template)
  • —評測 methodology(抽樣、評分、aggregation 全規格)
  • —範例 invocation code

已知 Limitations

  1. 1.LLM-as-Judge 偏差:用 Claude Opus 評分可能對特定文體有偏好。20 題人審用於校正,但 sample 數仍限。
  2. 2.Reference 不是絕對真理:reference answer 由 GPT-5.5 + schema validation 產出,反映「主流學術共識」而非「絕對正確」。
  3. 3.單次抽樣:每題每 model 跑 1 次,未做 self-consistency 多次抽樣平均。
  4. 4.語言限定:繁體中文,未測簡體或英文表現。

詳見 methodology.md §7。

Roadmap

  • —✅ v1.0(2026-05-24):120 題 + Methodology + Evaluator prompt
  • —🔜 v1.1:加入 multi-judge ensemble(Opus + GPT-4o + DeepSeek-V3)
  • —🔜 v2.0:eval set 擴增到 500-1,000 題

Citation

bibtex
@dataset{daoism_qa_eval_v1_2026,
  title        = {Daoism-QA-Eval-v1: A Benchmark Evaluation Set for Daoist LLMs},
  author       = {Liu, Bruce (鼎稔道學館 / lius.cc)},
  year         = 2026,
  month        = may,
  publisher    = {Hugging Face},
  version      = {1.0},
  url          = {https://huggingface.co/datasets/lius-cc/Daoism-QA-Eval-v1},
}

License

CC-BY-SA 4.0

Related Assets

Contact

Bruce Liu / 鼎稔道學館

  • —Website: https://lius.cc
  • —LLM Demo: https://demo.lius.cc
  • —Email: chiyingliu@gmail.com