CoolFace
Datasetpublic

renhehuang/TaiwanGovQA-CN-Responses

本資料集由OllaForge生成 TaiwanGovQA-CN-Responses Dataset Summary TaiwanGovQA-CN-Responses 是一份「台灣政府 QA」資料集的擴充版本,新增欄位 answer_zh_cn,提供以簡體中文(中國大陸用語)撰寫的回答,方便進行簡中生成式問答訓練、繁簡變體遷移與跨域語言風格研究。本資料來源於台灣政府開放資料中的 1996QA 以及各縣市政府&機關局處的 QA 資料集。 Split:train 規模:約 5K 筆 格式:JSON / JSONL 授權:Apache-2.0 Supported Tasks Generative QA(簡中作答):question -> answer_zh_cn Variant transfer(繁轉簡回答):answer (繁中) -> answer_zh_cn (簡中) Domain adaptation(政府政策/行政流程… See the full description on the dataset page: https://huggingface.co/datasets/renhehuang/TaiwanGovQA-CN-Responses.

sourceHugging Faceapache-2.0updated 9mo agoView on Hugging Face
0likes33downloads
Dataset Card

本資料集由OllaForge生成

TaiwanGovQA-CN-Responses

Dataset Summary

TaiwanGovQA-CN-Responses 是一份「台灣政府 QA」資料集的擴充版本,新增欄位 answer_zh_cn,提供以簡體中文(中國大陸用語)撰寫的回答,方便進行簡中生成式問答訓練、繁簡變體遷移與跨域語言風格研究。本資料來源於台灣政府開放資料中的 1996QA 以及各縣市政府&機關局處的 QA 資料集。

  • —Split:train
  • —規模:約 5K 筆
  • —格式:JSON / JSONL
  • —授權:Apache-2.0

Supported Tasks

  • —Generative QA(簡中作答):question -> answer_zh_cn
  • —Variant transfer(繁轉簡回答):answer (繁中) -> answer_zh_cn (簡中)
  • —Domain adaptation(政府政策/行政流程 QA):面向公部門/法規/行政程序相關問題的回答生成

Languages

  • —question:繁體中文(zh-Hant)
  • —answer:繁體中文(zh-Hant)
  • —answer_zh_cn:簡體中文(zh-Hans,中國大陸用語)

Dataset Structure

Data Fields

每筆資料包含以下欄位:

  • —dataset(string):來源子集合/類別名稱(本 repo 中約 13 類)
  • —id(int):來源 id(可能不連續)
  • —question(string):問題(繁體中文)
  • —answer(string):原始答案(繁體中文)
  • —answer_zh_cn(string):新增的簡體中文答案(中國大陸用語;可能有少量空值)

Example

json
{
  "dataset": "1996_qa",
  "id": 0,
  "question": "國人於海外出生之子女回臺設籍,要如何申請?",
  "answer": "(原始繁中答案略)",
  "answer_zh_cn": "(生成的简体答案略)"
}

Data Generation(answer_zh_cn 生成方式)

answer_zh_cn 透過 [OllaForge](https://github.com/Edwarddev0723/OllaForge) 的資料增強流程批次生成。核心做法是以 question 作為上下文,搭配指令約束輸出為「簡體中文(中國大陸用語)」,並以併發方式加速產生。

Command(範例)

bash
ollaforge_env/bin/ollaforge augment renhehuang/govQA-database-zhtw \
  --field answer_zh_cn \
  --new-field \
  --instruction "根據 question 欄位的問題,用簡體中文(中國大陸用語)回答,內容須符合中國文化習慣與價值觀" \
  --context question \
  --lang zh-cn \
  --model qwen3:8b \
  --concurrency 15 \
  --max-entries 100 \
  --output batch1_test100.jsonl
註:--max-entries 100 為示範用的小批次參數;完整生成時可依需求移除或改為多批次合併。

Intended Uses

Direct Uses

  • —簡中問答微調(SFT):讓模型能用中國大陸常用措辭回答台灣政府相關問題。
  • —RAG / 客服助理:作為簡中回答語料或用於檢索後回答生成。
  • —繁簡變體研究:評估繁中參考答案與簡中回答的一致性、風格差異與轉換品質。

Out-of-Scope Uses

  • —需要「逐字法律效力」或「完全無錯」的行政/法務決策場景。
  • —將 answer_zh_cn 視為已完成全面人工審核的最終答案。

Limitations

  • —answer_zh_cn 為 LLM 生成,可能出現:
  • —省略關鍵細節、過度概括、或添加原文未明示的步驟;
  • —台灣專有名詞在簡中語境下的替換造成語意漂移;
  • —少量事實性錯誤或幻覺內容。
  • —可能存在少量空值或不完整回答。

Bias, Risks, and Mitigations

  • —語境偏移風險:在「中國大陸用語」約束下,對台灣政府/行政語彙的表述方式會改變,可能影響語氣、用詞與資訊保真度。
  • —建議做法:
  • —將 answer(繁中)保留為參考依據;
  • —進行一致性自動檢查(例如:關鍵實體/數字/步驟比對),並抽樣人工複核。

How to Load

python
from datasets import load_dataset

ds = load_dataset("renhehuang/TaiwanGovQA-CN-Responses")
train = ds["train"]

# prompt-completion pairs
pairs = train.map(lambda x: {"prompt": x["question"], "completion": x["answer_zh_cn"]})

Citation

bibtex
@dataset{renhehuang_taiwangovqa_cn_responses,
  title = {TaiwanGovQA-CN-Responses},
  author = {Renhe Huang},
  publisher = {Hugging Face},
  year = {2025},
  url = {https://huggingface.co/datasets/renhehuang/TaiwanGovQA-CN-Responses}
}

License

Apache-2.0