yuuki14202028/fixed-kkc-dataset
Fixed KKC Dataset 日本語Wikipedia入力誤りデータセット (v2) から生成した、かな漢字変換(KKC)タスク用の選好ペアデータセットです。 データセットの概要 Wikipediaの編集差分のうち kanji-conversion_a カテゴリ(誤変換の修正)に該当するものを抽出しています。 各レコードは、カタカナの読みに対して「正しい漢字表記(chosen)」と「誤った表記(rejected)」のペアを持ちます。 かな漢字変換モデルの学習・評価や、選好学習(RLHF / DPO)に利用できます。 データ形式 各レコードは以下のフィールドを持つ JSON Lines 形式です。 フィールド 型 説明 left_context string 変換箇所より前の文脈テキスト prompt string 変換対象語のカタカナ読み chosen string 正しい漢字表記(Wikipedia編集後) rejected string… See the full description on the dataset page: https://huggingface.co/datasets/yuuki14202028/fixed-kkc-dataset.
165
