renhehuang/TaiwanGovQA-CN-Responses
本資料集由OllaForge生成 TaiwanGovQA-CN-Responses Dataset Summary TaiwanGovQA-CN-Responses 是一份「台灣政府 QA」資料集的擴充版本,新增欄位 answer_zh_cn,提供以簡體中文(中國大陸用語)撰寫的回答,方便進行簡中生成式問答訓練、繁簡變體遷移與跨域語言風格研究。本資料來源於台灣政府開放資料中的 1996QA 以及各縣市政府&機關局處的 QA 資料集。 Split:train 規模:約 5K 筆 格式:JSON / JSONL 授權:Apache-2.0 Supported Tasks Generative QA(簡中作答):question -> answer_zh_cn Variant transfer(繁轉簡回答):answer (繁中) -> answer_zh_cn (簡中) Domain adaptation(政府政策/行政流程… See the full description on the dataset page: https://huggingface.co/datasets/renhehuang/TaiwanGovQA-CN-Responses.
本資料集由OllaForge生成
TaiwanGovQA-CN-Responses
Dataset Summary
TaiwanGovQA-CN-Responses 是一份「台灣政府 QA」資料集的擴充版本,新增欄位 answer_zh_cn,提供以簡體中文(中國大陸用語)撰寫的回答,方便進行簡中生成式問答訓練、繁簡變體遷移與跨域語言風格研究。本資料來源於台灣政府開放資料中的 1996QA 以及各縣市政府&機關局處的 QA 資料集。
- Split:
train - 規模:約 5K 筆
- 格式:JSON / JSONL
- 授權:Apache-2.0
Supported Tasks
- Generative QA(簡中作答):
question -> answer_zh_cn - Variant transfer(繁轉簡回答):
answer (繁中) -> answer_zh_cn (簡中) - Domain adaptation(政府政策/行政流程 QA):面向公部門/法規/行政程序相關問題的回答生成
Languages
question:繁體中文(zh-Hant)answer:繁體中文(zh-Hant)answer_zh_cn:簡體中文(zh-Hans,中國大陸用語)
Dataset Structure
Data Fields
每筆資料包含以下欄位:
dataset(string):來源子集合/類別名稱(本 repo 中約 13 類)id(int):來源 id(可能不連續)question(string):問題(繁體中文)answer(string):原始答案(繁體中文)answer_zh_cn(string):新增的簡體中文答案(中國大陸用語;可能有少量空值)
Example
{
"dataset": "1996_qa",
"id": 0,
"question": "國人於海外出生之子女回臺設籍,要如何申請?",
"answer": "(原始繁中答案略)",
"answer_zh_cn": "(生成的简体答案略)"
}Data Generation(answer_zh_cn 生成方式)
answer_zh_cn 透過 [OllaForge](https://github.com/Edwarddev0723/OllaForge) 的資料增強流程批次生成。核心做法是以 question 作為上下文,搭配指令約束輸出為「簡體中文(中國大陸用語)」,並以併發方式加速產生。
Command(範例)
ollaforge_env/bin/ollaforge augment renhehuang/govQA-database-zhtw \
--field answer_zh_cn \
--new-field \
--instruction "根據 question 欄位的問題,用簡體中文(中國大陸用語)回答,內容須符合中國文化習慣與價值觀" \
--context question \
--lang zh-cn \
--model qwen3:8b \
--concurrency 15 \
--max-entries 100 \
--output batch1_test100.jsonl註:--max-entries 100 為示範用的小批次參數;完整生成時可依需求移除或改為多批次合併。Intended Uses
Direct Uses
- 簡中問答微調(SFT):讓模型能用中國大陸常用措辭回答台灣政府相關問題。
- RAG / 客服助理:作為簡中回答語料或用於檢索後回答生成。
- 繁簡變體研究:評估繁中參考答案與簡中回答的一致性、風格差異與轉換品質。
Out-of-Scope Uses
- 需要「逐字法律效力」或「完全無錯」的行政/法務決策場景。
- 將
answer_zh_cn視為已完成全面人工審核的最終答案。
Limitations
answer_zh_cn為 LLM 生成,可能出現:- 省略關鍵細節、過度概括、或添加原文未明示的步驟;
- 台灣專有名詞在簡中語境下的替換造成語意漂移;
- 少量事實性錯誤或幻覺內容。
- 可能存在少量空值或不完整回答。
Bias, Risks, and Mitigations
- 語境偏移風險:在「中國大陸用語」約束下,對台灣政府/行政語彙的表述方式會改變,可能影響語氣、用詞與資訊保真度。
- 建議做法:
- 將
answer(繁中)保留為參考依據; - 進行一致性自動檢查(例如:關鍵實體/數字/步驟比對),並抽樣人工複核。
How to Load
from datasets import load_dataset
ds = load_dataset("renhehuang/TaiwanGovQA-CN-Responses")
train = ds["train"]
# prompt-completion pairs
pairs = train.map(lambda x: {"prompt": x["question"], "completion": x["answer_zh_cn"]})Citation
@dataset{renhehuang_taiwangovqa_cn_responses,
title = {TaiwanGovQA-CN-Responses},
author = {Renhe Huang},
publisher = {Hugging Face},
year = {2025},
url = {https://huggingface.co/datasets/renhehuang/TaiwanGovQA-CN-Responses}
}License
Apache-2.0
