mahiyama/kosodate-faq-pairs-ja
子育てAIチャットボット 汎用FAQ (anchor/positive pairs, ja) Dataset Summary 本データセットは、「子育てオープンデータ協議会」が 2020 年に公開した 「子育てAIチャットボットの利活用促進に向けた検討 2020年報告書」附属の FAQ データセット を加工し、Sentence Transformers 互換の (anchor, positive) positive pair 形式 に変換したものです。 anchor: ユーザー側のサンプル問合せ文(自然な表現での質問) positive: それに対応する FAQ 項目 / サンプル応答文(正解ドキュメント) 日本語テキスト埋め込みモデル(例: 日本語 BERT/SBERT, SPLADE, ColBERT, ELSER 類似の日本語スパース検索モデルなど)の fine-tune / 評価 用途や、自治体 FAQ を対象とした RAG システムの Retrieval コーパスとしてそのまま利用できます。… See the full description on the dataset page: https://huggingface.co/datasets/mahiyama/kosodate-faq-pairs-ja.
子育てAIチャットボット 汎用FAQ (anchor/positive pairs, ja)
Dataset Summary
本データセットは、「子育てオープンデータ協議会」が 2020 年に公開した 「子育てAIチャットボットの利活用促進に向けた検討 2020年報告書」附属の FAQ データセット を加工し、Sentence Transformers 互換の (anchor, positive) positive pair 形式 に変換したものです。
- `anchor`: ユーザー側のサンプル問合せ文(自然な表現での質問)
- `positive`: それに対応する FAQ 項目 / サンプル応答文(正解ドキュメント)
日本語テキスト埋め込みモデル(例: 日本語 BERT/SBERT, SPLADE, ColBERT, ELSER 類似の日本語スパース検索モデルなど)の fine-tune / 評価 用途や、自治体 FAQ を対象とした RAG システムの Retrieval コーパスとしてそのまま利用できます。
Supported Tasks
- Sentence Similarity / Feature Extraction —
MultipleNegativesRankingLossなどで埋め込みモデルの fine-tune に利用 - Text Retrieval — FAQ 検索モデルの学習・評価
- Question Answering (FAQ 検索型) — RAG パイプラインの Retrieval コーパス
Recommended Losses
(anchor, positive) pair 形式と互換のある主要な損失関数:
MultipleNegativesRankingLoss(最も一般的)CachedMultipleNegativesRankingLossGISTEmbedLoss/CachedGISTEmbedLoss
mine_hard_negatives() を使えば、このデータから (anchor, positive, negative) triplet への拡張も可能です。
Languages
日本語 (ja)
Dataset Structure
Data Fields
Data Instances
{
"anchor": "[サンプル問合せ文の例]",
"positive": "[対応する FAQ 応答の例]"
}Data Splits
Dataset Creation
Source Data
- 原データ: 子育てオープンデータ協議会「汎用 FAQ データセット」(Excel 形式)
- アスコエパートナーズ版: <https://www.asukoe.co.jp/wp-content/uploads/342cebcee287f1fbe89944e56ea7a8fe.xlsx>
- LINE 株式会社版 (zip): <https://d.line-scdn.net/stf/linecorp/ja/csr/dataset_.zip>
- 報告書: <https://www.asukoe.co.jp/wp-content/uploads/1035de1188f6d35dd7169d05e3823fb5.pdf>
原データは、渋谷区の FAQ をベースに、どの自治体でも利用できるよう「子育てオープンデータ協議会」(LINE 株式会社、株式会社 ALBERT、株式会社アスコエパートナーズ、参画自治体、有識者により構成)が汎用化したものです。
Preprocessing (本リポジトリでの加工)
CC BY 4.0 の要件に従い、以下の改変を行ったことを明示します。
- 形式変換: Excel (
.xlsx) から Parquet / JSONL へ変換 - 列の再構成: Sentence Transformers 互換の
(anchor, positive)2 列構造に再構成 anchor← 原データのサンプル問合せ文列positive← 原データの FAQ 項目 / サンプル応答文列- 不要文言の除去: 学習ノイズとなる明らかに不要な定型文言・注釈等の削除
- [その他、実施した加工があれば追記]
加工していないこと: FAQ の意味内容や応答の本質は変更していません。
Considerations for Using the Data
Intended Use
- 日本語テキスト埋め込みモデルの fine-tune・評価
- 自治体 FAQ ドメインでの retrieval ベンチマーク
- 行政 FAQ RAG システムの検索コーパスの一部
Social Impact of Dataset
自治体における行政サービス案内の標準化・オープンデータ化、および日本語検索・RAG 技術の発展に寄与します。
Discussion of Biases
- FAQ は主に 渋谷区のデータをベースに汎用化 されているため、地方部の自治体固有の制度・呼称・語彙が十分に反映されていない可能性があります。
- 2020 年時点の制度・名称が前提のため、その後の制度改正には追従していません。
- 「標準的な」記述が目的で作成されているため、多様な家族形態・言語背景(外国語話者、ひとり親、障害のある子ども等)の網羅性は限定的です。
Other Known Limitations
- 応答文中に自治体固有情報のプレースホルダが残っている場合があり、実運用には各自治体情報の補完が必要です。
- データ量は FAQ ドメインに特化しており、一般ドメインの埋め込み学習には別途コーパスを組み合わせることを推奨します。
Additional Information
Licensing Information
本データセットは、原データと同じく Creative Commons Attribution 4.0 International License (CC BY 4.0) のもとで公開されます。
- ライセンス本文: <https://creativecommons.org/licenses/by/4.0/legalcode.ja>
- 商用利用・改変・再配布すべて許諾されています(帰属表示が必要)。
必須のクレジット表記(利用する Web サイト / プロダクトに明記してください):
CC-BY 4.0 子育てオープンデータ協議会
(本データは子育てオープンデータ協議会の原データを mahiyama が加工したものです)Citation Information
原データセット:
子育てオープンデータ協議会. (2020).
子育てAIチャットボットの利活用促進に向けた検討 2020年報告書 / FAQデータセット.
https://linecorp.com/ja/csr/newslist/ja/2020/260本リポジトリ:
@misc{mahiyama_kosodate_faq_pairs_ja_2026,
author = {mahiyama},
title = {子育てAIチャットボット 汎用FAQ (anchor/positive pairs, ja)},
year = {2026},
howpublished = {\url{https://huggingface.co/datasets/mahiyama/kosodate-faq-pairs-ja}},
note = {Derived from the Kosodate Open Data Council FAQ dataset (CC BY 4.0)}
}Contributions
- 原データ作成: 子育てオープンデータ協議会(LINE 株式会社、株式会社 ALBERT、株式会社アスコエパートナーズ、参画自治体、有識者)
- 加工・Hugging Face への公開: @mahiyama
Usage Example
from datasets import load_dataset
from sentence_transformers import SentenceTransformer, SentenceTransformerTrainer
from sentence_transformers.losses import MultipleNegativesRankingLoss
# Load dataset
dataset = load_dataset("mahiyama/kosodate-faq-pairs-ja", split="train")
print(dataset[0]) # {"anchor": "...", "positive": "..."}
# Fine-tune a Japanese embedding model
model = SentenceTransformer("cl-nagoya/ruri-v3-310m") # 例
loss = MultipleNegativesRankingLoss(model)
trainer = SentenceTransformerTrainer(
model=model,
train_dataset=dataset,
loss=loss,
)
trainer.train()Related Resources
- プレスリリース(PR TIMES): <https://prtimes.jp/main/html/rd/p/000000028.000055044.html>
- アスコエパートナーズ ニュース: <https://www.asukoe.co.jp/news/kosodateopendatareport/>
- LINE 株式会社 CSR レポート: <https://linecorp.com/ja/csr/newslist/ja/2020/260>
- Sentence Transformers Dataset Overview: <https://sbert.net/docs/sentencetransformer/datasetoverview.html>
