CoolFace
Datasetpublic

yuuki14202028/fixed-kkc-dataset

Fixed KKC Dataset 日本語Wikipedia入力誤りデータセット (v2) から生成した、かな漢字変換(KKC)タスク用の選好ペアデータセットです。 データセットの概要 Wikipediaの編集差分のうち kanji-conversion_a カテゴリ(誤変換の修正)に該当するものを抽出しています。 各レコードは、カタカナの読みに対して「正しい漢字表記(chosen)」と「誤った表記(rejected)」のペアを持ちます。 かな漢字変換モデルの学習・評価や、選好学習(RLHF / DPO)に利用できます。 データ形式 各レコードは以下のフィールドを持つ JSON Lines 形式です。 フィールド 型 説明 left_context string 変換箇所より前の文脈テキスト prompt string 変換対象語のカタカナ読み chosen string 正しい漢字表記(Wikipedia編集後) rejected string… See the full description on the dataset page: https://huggingface.co/datasets/yuuki14202028/fixed-kkc-dataset.

sourceHugging Facecc-by-sa-3.0updated 7mo agoView on Hugging Face
1likes64downloads
Dataset Card

Fixed KKC Dataset

日本語Wikipedia入力誤りデータセット (v2) から生成した、かな漢字変換(KKC)タスク用の選好ペアデータセットです。

データセットの概要

Wikipediaの編集差分のうち kanji-conversion_a カテゴリ(誤変換の修正)に該当するものを抽出しています。 各レコードは、カタカナの読みに対して「正しい漢字表記(chosen)」と「誤った表記(rejected)」のペアを持ちます。 かな漢字変換モデルの学習・評価や、選好学習(RLHF / DPO)に利用できます。

データ形式

各レコードは以下のフィールドを持つ JSON Lines 形式です。

フィールド型説明
left_contextstring変換箇所より前の文脈テキスト
promptstring変換対象語のカタカナ読み
chosenstring正しい漢字表記(Wikipedia編集後)
rejectedstring誤った漢字表記(Wikipedia編集前)

例

json
{
  "left_context": "議員の除名には、出席",
  "prompt": "ギイン",
  "chosen": "議員",
  "rejected": "議院"
}
json
{
  "left_context": "個人の言語能力は、全体的な知的能力とは乖離することがあり(例として読字障害、ウィリアムズ症候群、自閉症など)、",
  "prompt": "コタイ",
  "chosen": "個体",
  "rejected": "固体"
}
json
{
  "left_context": "中世末期から江戸時代にかけて、「は行」の子音は から へ",
  "prompt": "イコウ",
  "chosen": "移行",
  "rejected": "以降"
}

データ規模

スプリットレコード数
train263,346
test1,887

元データ(日本語Wikipedia入力誤りデータセット v2)における kanji-conversion_a カテゴリの件数は、train: 696,189件中 263,346件(約37.8%)、test: 5,440件中 1,887件(約34.7%)です。

使い方

python
from datasets import load_dataset

ds = load_dataset("yuuki14202028/fixed-kkc-dataset")

# train スプリットの最初のレコード
print(ds["train"][0])
# {
#   "left_context": "...",
#   "prompt": "カタカナ読み",
#   "chosen": "正しい漢字",
#   "rejected": "誤った漢字"
# }

DPO / 選好学習での利用例

python
from datasets import load_dataset

ds = load_dataset("yuuki14202028/fixed-kkc-dataset")

def format_example(example):
    instruction = f"{example['left_context']}[{example['prompt']}]"
    return {
        "prompt": instruction,
        "chosen": example["chosen"],
        "rejected": example["rejected"],
    }

ds = ds.map(format_example)

データソース

本データセットは 日本語Wikipedia入力誤りデータセット (v2)(京都大学)を元に生成しました。

変換処理(カタカナ読みの付与)には MeCab + mozc-as-ma 辞書を使用しています。

ライセンス

CC-BY-SA 3.0

元データセットと同じライセンスに従います。本データセットを利用・再配布する場合は、同ライセンスの条件に従い、適切なクレジットを表示してください。