CoolFace
Datasetpublic

ikedachin/std_lang_wiki_qa_v4_validated_w_reasoning_effort_llmjp4

Standard Japanese Wiki QA v4 with Reasoning Effort — LLM-jp 4 概要 Imabari Wiki QA v4 with Reasoning Effort — LLM-jp 4 の thinking(思考文)と answer(最終回答)の言葉遣いを標準語(です・ます調)へ変換した派生データセットです。日本語QAの教師ありファインチューニング(SFT)や、reasoning effort に応じた説明文・回答の生成に利用できます。 質問に新たに回答したり、推論内容を追加したりすることは目的としていません。元の意味・結論・根拠を保持し、今治弁などの方言表現を標準語へ置き換えるよう指示しています。質問は変換対象に含めていません。 LLM-jp 4 のチャットテンプレート用に、assistant の content に最終回答、thinking に思考文を格納しています。「LLM-jp 4」は対象のデータ形式を示します。元の思考文生成モデルと標準語化の設定モデルは… See the full description on the dataset page: https://huggingface.co/datasets/ikedachin/std_lang_wiki_qa_v4_validated_w_reasoning_effort_llmjp4.

sourceHugging Facecc-by-sa-4.0updated 4d agoView on Hugging Face
0likes66downloads
Dataset Card

Standard Japanese Wiki QA v4 with Reasoning Effort — LLM-jp 4

概要

Imabari Wiki QA v4 with Reasoning Effort — LLM-jp 4 の `thinking`(思考文)と `answer`(最終回答)の言葉遣いを標準語(です・ます調)へ変換した派生データセットです。日本語QAの教師ありファインチューニング(SFT)や、reasoning effort に応じた説明文・回答の生成に利用できます。

質問に新たに回答したり、推論内容を追加したりすることは目的としていません。元の意味・結論・根拠を保持し、今治弁などの方言表現を標準語へ置き換えるよう指示しています。質問は変換対象に含めていません。

LLM-jp 4 のチャットテンプレート用に、assistant の content に最終回答、thinking に思考文を格納しています。「LLM-jp 4」は対象のデータ形式を示します。元の思考文生成モデルと標準語化の設定モデルは Qwen3.8-27B-NVFP4 です。

対象分野は今治の地域知識だけに限定されず、元QAに含まれる人物・歴史・交通・文化などを扱います。

元データからの変更

  • —thinking と answer を標準語化し、messages 内の対応する文章にも反映しました。
  • —question、reasoning_effort、chat_template_kwargs、出典情報を引き継いでいます。
  • —変換後の思考文について thinking_tokens を再計数しています。
  • —変換後の文章を元の評価値で評価済みと扱わないため、eval は全件 null です。
  • —変換結果用の qa_id を付与しています。元QAへの対応は source_qa_id と source_metadata.qa_id で確認できます。
  • —アップロード時にレコード単位で train / validation を再分割します。派生元の分割を維持したものではありません。

派生元の公開カードに記載された件数は14,735件ですが、この版の入力ファイルには 14,707件が含まれています。以下の統計は本版の実ファイルに基づきます。28件の差の原因は本カードでは特定していません。

収録数と分割

Split件数lowmediumhigh
train13,2376,0925,5071,638
validation1,470683599188
合計14,7076,7756,1061,826

元QA ID(source_qa_id)は 7,253種類、記事ID(id)は 2,293種類です。すべての元QAに3段階のeffortが揃っているわけではありません。

アップロード用ノートブック tool_upload_imabari_qa_v4_to_huggingface.ipynb と main_upload_dataset.py は、入力順の全レコードを Python の random.Random(42).shuffle でシャッフルし、先頭の int(件数 × 0.1) 件を検証用、残りを学習用にします。上表は現在の入力ファイルとこの処理から算出した件数です。

全レコードを保持し、内容や id + chunk_index による重複除去は行いません。アップロード準備では既存の一意な qa_id を維持し、重複時にUUIDv4へ置き換えます。本版の14,707件の qa_id はすべて一意です。item_id は配布対象から除外されます。

元QAや記事単位で分離した分割ではありません。 この分割では、1,194種類の元QA ID、948種類の記事IDが両splitに共通します。未知の質問や記事への性能を評価する際には、目的に応じて元QA・記事単位で再分割してください。派生元データとの併用でも同じQAの混入に注意が必要です。

思考文の長さ

reasoning_effort件数thinking_tokens 最小–最大平均
low6,77552–19796.6
medium6,106170–592249.1
high1,826500–1,489688.7

thinking_tokens は llm-jp/llm-jp-4-8b-thinking のトークナイザーで計数した標準語化後の思考本文のトークン数です。質問・最終回答・チャットテンプレートは含みません。effortラベルは元データから保持され、変換後の長さで再分類していません。長さチェックの設定範囲外でも、ラベルを保持して保存する仕様です。

データ構造

UTF-8のJSONL形式で、1行に1レコードを格納します。

フィールドJSON上の型説明
qa_idstring本版のレコードを識別する一意なID
source_qa_idstring元QAのID。異なるeffortのレコードが共有し得る
idstring元記事のID
chunk_indexinteger元記事内のチャンク番号
questionstring元データから引き継いだ質問
answerstring標準語化した最終回答
thinkingstring標準語化したMarkdown形式の思考文
reasoning_effortstringlow / medium / high
evalnull全件 null。標準語化後の評価点は未付与
messagesarray of objectsuserとassistantの2メッセージ
chat_template_kwargsobjectreasoning_effort と conversation_start_date
thinking_tokensinteger標準語化後の思考本文のトークン数
thinking_generatorstring元の思考文生成モデル。全件 Qwen3.8-27B-NVFP4
source_metadataobject元QAの qa_id、記事の id、chunk_index

conversation_start_date は全件 "2026-09-11" です。チャットテンプレート用の固定値であり、記事公開日や標準語化の実施日ではありません。元記事の本文は本版のレコードに含みません。

実データの例

json
{
  "qa_id": "286f4200d9a3a5552197b33a658d56158b0f2148c017d2460e11021464b02114:llm_jp_4",
  "source_qa_id": "fef0fdd0-ac75-4a1f-8794-6290aa61b6bc",
  "id": "2164118",
  "chunk_index": 0,
  "question": "映画『真田風雲録』に出演した笹木俊志が演じた役柄は何か?",
  "answer": "交通整理される先兵たちを演じています。",
  "thinking": "## 思考プロセス\n\n### 1. 質問の整理\n\n笹木俊志が映画『真田風雲録』で演じた役柄を聞かれているので、この作品に絞って確認します。\n\n### 2. 答えへの接続\n\n1963年の『真田風雲録』では交通整理される先兵たちを演じていると書かれています。したがって、この役柄が答えになります。",
  "reasoning_effort": "low",
  "eval": null,
  "messages": [
    {
      "role": "user",
      "content": "映画『真田風雲録』に出演した笹木俊志が演じた役柄は何か?"
    },
    {
      "role": "assistant",
      "content": "交通整理される先兵たちを演じています。",
      "thinking": "## 思考プロセス\n\n### 1. 質問の整理\n\n笹木俊志が映画『真田風雲録』で演じた役柄を聞かれているので、この作品に絞って確認します。\n\n### 2. 答えへの接続\n\n1963年の『真田風雲録』では交通整理される先兵たちを演じていると書かれています。したがって、この役柄が答えになります。"
    }
  ],
  "chat_template_kwargs": {
    "reasoning_effort": "low",
    "conversation_start_date": "2026-09-11"
  },
  "thinking_tokens": 81,
  "thinking_generator": "Qwen3.8-27B-NVFP4",
  "source_metadata": {
    "qa_id": "fef0fdd0-ac75-4a1f-8794-6290aa61b6bc",
    "id": "2164118",
    "chunk_index": 0
  }
}

作成方法

派生元では、検証を経たQAの質問・最終回答と元記事の文脈を使い、effort条件に応じた説明文を生成しています。詳細は派生元データセットカードを参照してください。

本版では、その thinking と answer のみを標準語へ変換します。ローカルの変換設定・プロンプト(temporary_tools/standardize_reasoning_dataset/)では、次の条件を指定しています。

  • —元の意味・結論・根拠・条件・否定・確実性の程度を維持する。
  • —固有名詞・数値・年月日・単位・引用内容を保持し、情報の追加・削除・要約・事実訂正を行わない。
  • —thinking のMarkdown見出しや構造を維持し、本文の言葉遣いを変更する。
  • —質問は文脈の参照にのみ使い、新たな回答や思考過程を追加しない。

これらは変換時の指示であり、全レコードについて意味の完全な一致を人手で保証したものではありません。

標準語化の設定値
モデルQwen3.8-27B-NVFP4
temperature0.1
top_p0.95
max_tokens8192
enable_thinkingfalse
再計数用トークナイザーllm-jp/llm-jp-4-8b-thinking
トークナイザーrevisionfc7c15c262710016c19bcda4372a96ff68875846

変換プログラムでは、出力キー、空でない文字列、数値の出現回数、Markdown見出しの一致、思考文の形式を機械的に検証します。固有名詞や意味・論理の完全な一致まで自動検証するものではありません。

利用例

python
from datasets import load_dataset

repo_id = "ikedachin/std_lang_wiki_qa_v4_validated_w_reasoning_effort_llmjp4"
dataset = load_dataset(repo_id)
record = dataset["train"][0]

question = record["question"]
answer = record["answer"]
thinking = record["thinking"]
messages = record["messages"]
chat_template_kwargs = record["chat_template_kwargs"]

非公開リポジトリの場合は、アクセス権を持つHugging Faceアカウントで事前に認証してください。

LLM-jp 4用のテンプレートを適用する際には、messages に加え、レコードの chat_template_kwargs を引数として渡してください。tokenizer は対応するチャットテンプレートを持つものを使用します。

python
text = tokenizer.apply_chat_template(
    record["messages"],
    tokenize=False,
    add_generation_prompt=False,
    **record["chat_template_kwargs"],
)

assistantの content だけでは思考文は含まれません。思考文付き学習には thinking を扱うテンプレートと前処理が必要です。回答のみの学習では question と answer を利用できます。

用途・検証範囲・制約

主な用途は、日本語QAのSFT、LoRA/QLoRA、effort条件付きの説明文生成、方言版と標準語版の表現比較です。

  • —リポジトリ名の validated は元QAの来歴を反映します。標準語化後の全件について、人手による事実・論理・意味保存の再検証を示すものではありません。eval は全件 null です。
  • —thinking は既知の最終回答に対応して生成された説明文を標準語化したものです。モデル内部の実際の思考過程の記録ではありません。
  • —元QAや生成説明の誤り・偏り、標準語化による意味のずれや方言表現の残存があり得ます。事実訂正を目的とするデータセットではありません。
  • —effortごとの件数は不均等です。高いeffortや長い説明文が高い正確性を意味するわけではありません。
  • —元記事本文を含まないため、このデータだけで記事に対する根拠照合を完結させることはできません。
  • —レコード単位の分割には元QA・記事の重複があり、そのまま未知質問への独立ベンチマークとして扱うことはできません。

ライセンスと出典

本データセットは派生元と同じ CC BY-SA 4.0(cc-by-sa-4.0)で提供します。

本派生版での変更は、思考文・最終回答の標準語化、それに伴うメッセージ更新・トークン再計数・評価値のクリア・レコードIDの更新、および配布用splitの再作成です。元資料の帰属情報と併せて、出典・ライセンス・変更内容を参照してください。