CoolFace
Datasetpublic

mahiyama/kosodate-faq-pairs-ja

子育てAIチャットボット 汎用FAQ (anchor/positive pairs, ja) Dataset Summary 本データセットは、「子育てオープンデータ協議会」が 2020 年に公開した 「子育てAIチャットボットの利活用促進に向けた検討 2020年報告書」附属の FAQ データセット を加工し、Sentence Transformers 互換の (anchor, positive) positive pair 形式 に変換したものです。 anchor: ユーザー側のサンプル問合せ文(自然な表現での質問) positive: それに対応する FAQ 項目 / サンプル応答文(正解ドキュメント) 日本語テキスト埋め込みモデル(例: 日本語 BERT/SBERT, SPLADE, ColBERT, ELSER 類似の日本語スパース検索モデルなど)の fine-tune / 評価 用途や、自治体 FAQ を対象とした RAG システムの Retrieval コーパスとしてそのまま利用できます。… See the full description on the dataset page: https://huggingface.co/datasets/mahiyama/kosodate-faq-pairs-ja.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
0likes23downloads
Dataset Card

子育てAIチャットボット 汎用FAQ (anchor/positive pairs, ja)

Dataset Summary

本データセットは、「子育てオープンデータ協議会」が 2020 年に公開した 「子育てAIチャットボットの利活用促進に向けた検討 2020年報告書」附属の FAQ データセット を加工し、Sentence Transformers 互換の (anchor, positive) positive pair 形式 に変換したものです。

  • —`anchor`: ユーザー側のサンプル問合せ文(自然な表現での質問)
  • —`positive`: それに対応する FAQ 項目 / サンプル応答文(正解ドキュメント)

日本語テキスト埋め込みモデル(例: 日本語 BERT/SBERT, SPLADE, ColBERT, ELSER 類似の日本語スパース検索モデルなど)の fine-tune / 評価 用途や、自治体 FAQ を対象とした RAG システムの Retrieval コーパスとしてそのまま利用できます。

Supported Tasks

  • —Sentence Similarity / Feature Extraction — MultipleNegativesRankingLoss などで埋め込みモデルの fine-tune に利用
  • —Text Retrieval — FAQ 検索モデルの学習・評価
  • —Question Answering (FAQ 検索型) — RAG パイプラインの Retrieval コーパス

Recommended Losses

(anchor, positive) pair 形式と互換のある主要な損失関数:

  • —MultipleNegativesRankingLoss(最も一般的)
  • —CachedMultipleNegativesRankingLoss
  • —GISTEmbedLoss / CachedGISTEmbedLoss

mine_hard_negatives() を使えば、このデータから (anchor, positive, negative) triplet への拡張も可能です。

Languages

日本語 (ja)

Dataset Structure

Data Fields

FieldTypeDescription
anchorstringサンプル問合せ文(ユーザーが入力しうる自然な質問)
positivestring対応する FAQ 項目 / サンプル応答文

Data Instances

json
{
  "anchor": "[サンプル問合せ文の例]",
  "positive": "[対応する FAQ 応答の例]"
}

Data Splits

SplitExamples
train[件数を記入]

Dataset Creation

Source Data

  • —原データ: 子育てオープンデータ協議会「汎用 FAQ データセット」(Excel 形式)
  • —アスコエパートナーズ版: <https://www.asukoe.co.jp/wp-content/uploads/342cebcee287f1fbe89944e56ea7a8fe.xlsx>
  • —LINE 株式会社版 (zip): <https://d.line-scdn.net/stf/linecorp/ja/csr/dataset_.zip>
  • —報告書: <https://www.asukoe.co.jp/wp-content/uploads/1035de1188f6d35dd7169d05e3823fb5.pdf>

原データは、渋谷区の FAQ をベースに、どの自治体でも利用できるよう「子育てオープンデータ協議会」(LINE 株式会社、株式会社 ALBERT、株式会社アスコエパートナーズ、参画自治体、有識者により構成)が汎用化したものです。

Preprocessing (本リポジトリでの加工)

CC BY 4.0 の要件に従い、以下の改変を行ったことを明示します。

  1. 1.形式変換: Excel (.xlsx) から Parquet / JSONL へ変換
  2. 2.列の再構成: Sentence Transformers 互換の (anchor, positive) 2 列構造に再構成
  3. 3.anchor ← 原データのサンプル問合せ文列
  4. 4.positive ← 原データの FAQ 項目 / サンプル応答文列
  5. 5.不要文言の除去: 学習ノイズとなる明らかに不要な定型文言・注釈等の削除
  6. 6.[その他、実施した加工があれば追記]

加工していないこと: FAQ の意味内容や応答の本質は変更していません。

Considerations for Using the Data

Intended Use

  • —日本語テキスト埋め込みモデルの fine-tune・評価
  • —自治体 FAQ ドメインでの retrieval ベンチマーク
  • —行政 FAQ RAG システムの検索コーパスの一部

Social Impact of Dataset

自治体における行政サービス案内の標準化・オープンデータ化、および日本語検索・RAG 技術の発展に寄与します。

Discussion of Biases

  • —FAQ は主に 渋谷区のデータをベースに汎用化 されているため、地方部の自治体固有の制度・呼称・語彙が十分に反映されていない可能性があります。
  • —2020 年時点の制度・名称が前提のため、その後の制度改正には追従していません。
  • —「標準的な」記述が目的で作成されているため、多様な家族形態・言語背景(外国語話者、ひとり親、障害のある子ども等)の網羅性は限定的です。

Other Known Limitations

  • —応答文中に自治体固有情報のプレースホルダが残っている場合があり、実運用には各自治体情報の補完が必要です。
  • —データ量は FAQ ドメインに特化しており、一般ドメインの埋め込み学習には別途コーパスを組み合わせることを推奨します。

Additional Information

Licensing Information

本データセットは、原データと同じく Creative Commons Attribution 4.0 International License (CC BY 4.0) のもとで公開されます。

  • —ライセンス本文: <https://creativecommons.org/licenses/by/4.0/legalcode.ja>
  • —商用利用・改変・再配布すべて許諾されています(帰属表示が必要)。

必須のクレジット表記(利用する Web サイト / プロダクトに明記してください):

CC-BY 4.0 子育てオープンデータ協議会
(本データは子育てオープンデータ協議会の原データを mahiyama が加工したものです)

Citation Information

原データセット:

子育てオープンデータ協議会. (2020).
子育てAIチャットボットの利活用促進に向けた検討 2020年報告書 / FAQデータセット.
https://linecorp.com/ja/csr/newslist/ja/2020/260

本リポジトリ:

@misc{mahiyama_kosodate_faq_pairs_ja_2026,
  author = {mahiyama},
  title  = {子育てAIチャットボット 汎用FAQ (anchor/positive pairs, ja)},
  year   = {2026},
  howpublished = {\url{https://huggingface.co/datasets/mahiyama/kosodate-faq-pairs-ja}},
  note = {Derived from the Kosodate Open Data Council FAQ dataset (CC BY 4.0)}
}

Contributions

  • —原データ作成: 子育てオープンデータ協議会(LINE 株式会社、株式会社 ALBERT、株式会社アスコエパートナーズ、参画自治体、有識者)
  • —加工・Hugging Face への公開: @mahiyama

Usage Example

python
from datasets import load_dataset
from sentence_transformers import SentenceTransformer, SentenceTransformerTrainer
from sentence_transformers.losses import MultipleNegativesRankingLoss

# Load dataset
dataset = load_dataset("mahiyama/kosodate-faq-pairs-ja", split="train")
print(dataset[0])  # {"anchor": "...", "positive": "..."}

# Fine-tune a Japanese embedding model
model = SentenceTransformer("cl-nagoya/ruri-v3-310m")  # 例
loss = MultipleNegativesRankingLoss(model)

trainer = SentenceTransformerTrainer(
    model=model,
    train_dataset=dataset,
    loss=loss,
)
trainer.train()

Related Resources

  • —プレスリリース(PR TIMES): <https://prtimes.jp/main/html/rd/p/000000028.000055044.html>
  • —アスコエパートナーズ ニュース: <https://www.asukoe.co.jp/news/kosodateopendatareport/>
  • —LINE 株式会社 CSR レポート: <https://linecorp.com/ja/csr/newslist/ja/2020/260>
  • —Sentence Transformers Dataset Overview: <https://sbert.net/docs/sentencetransformer/datasetoverview.html>