CoolFace
Datasetpublic

akira-sasaki/nihongo-dojo-beginner-10k

Nihongo DoJo 初級日本語学習データセット 概要 このデータセットは、日本語学習者向けの合成データセットです。GRPO (Group Relative Policy Optimization) を用いた日本語言語モデルの学習に最適化されています。 データセット統計 総サンプル数: 10,000 言語: 日本語 難易度: 初級(N5-N4相当) 対象: 日本語学習者、言語モデル研究者 タスクタイプ 漢字読み問題 (25%) 例: 「学校」の読み方は? → がっこう 漢字書き問題 (15%) 例: 「みず」を漢字で書いてください → 水 助詞穴埋め問題 (20%) 例: 私_学校_行きます → は、に 助数詞問題 (15%) 例: 3つの本を数えるときの正しい数え方は? → さんさつ 語順並べ替え問題 (10%) 例: 友達と / 公園で / 遊びました → 友達と公園で遊びました 文法問題 (10%) 例:… See the full description on the dataset page: https://huggingface.co/datasets/akira-sasaki/nihongo-dojo-beginner-10k.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes29downloads
Dataset Card

Nihongo DoJo 初級日本語学習データセット

概要

このデータセットは、日本語学習者向けの合成データセットです。GRPO (Group Relative Policy Optimization) を用いた日本語言語モデルの学習に最適化されています。

データセット統計

  • —総サンプル数: 10,000
  • —言語: 日本語
  • —難易度: 初級(N5-N4相当)
  • —対象: 日本語学習者、言語モデル研究者

タスクタイプ

  1. 1.漢字読み問題 (25%)
  2. 2.例: 「学校」の読み方は? → がっこう
  1. 1.漢字書き問題 (15%)
  2. 2.例: 「みず」を漢字で書いてください → 水
  1. 1.助詞穴埋め問題 (20%)
  2. 2.例: 私_学校_行きます → は、に
  1. 1.助数詞問題 (15%)
  2. 2.例: 3つの本を数えるときの正しい数え方は? → さんさつ
  1. 1.語順並べ替え問題 (10%)
  2. 2.例: 友達と / 公園で / 遊びました → 友達と公園で遊びました
  1. 1.文法問題 (10%)
  2. 2.例: 「今、宿題を_」の_に入る正しい形は? → しています
  1. 1.読解問題 (5%)
  2. 2.短い文章を読んで質問に答える

データ形式

基本形式

json
{
  "problem": "「学校」の読み方は?",
  "solution": "がっこう",
  "reasoning": "「学」は「がく」、「校」は「こう」と読みます。",
  "type": "kanji_reading",
  "difficulty": "beginner",
  "grade": 2
}

GRPO形式

json
{
  "instruction": "次の問題に答えてください。",
  "input": "「学校」の読み方は?",
  "output": "<思考開始>\n「学」は「がく」、「校」は「こう」と読みます。\n</思考終了>\n<解答>がっこう</解答>",
  "group_id": 0,
  "task_idx": 0,
  "task_type": "kanji_reading",
  "difficulty": "beginner"
}

使用方法

python
from datasets import load_dataset

# データセットの読み込み
dataset = load_dataset("akira-sasaki/nihongo-dojo-beginner-10k")

# 最初のサンプルを確認
print(dataset['train'][0])

# タスクタイプでフィルタリング
kanji_tasks = dataset['train'].filter(lambda x: x['type'] == 'kanji_reading')

ライセンス

このデータセットは Apache License 2.0 の下で公開されています。

引用

このデータセットを使用する場合は、以下のように引用してください:

bibtex
@dataset{nihongo_dojo_beginner_2024,
  title={Nihongo DoJo Beginner Japanese Dataset},
  author={Nihongo DoJo Team},
  year={2024},
  publisher={Hugging Face}
}

謝辞

このデータセットは、常用漢字(小学1-3年生)をベースに生成されました。

制限事項

  • —このデータセットは合成的に生成されたものであり、実際の日本語使用とは異なる場合があります
  • —初級レベルに限定されているため、上級者向けの学習には適していません
  • —重複する問題が含まれている可能性があります

更新履歴

  • —2024-01-08: 初版リリース (10,000サンプル)