akira-sasaki/nihongo-dojo-beginner-10k
Nihongo DoJo 初級日本語学習データセット 概要 このデータセットは、日本語学習者向けの合成データセットです。GRPO (Group Relative Policy Optimization) を用いた日本語言語モデルの学習に最適化されています。 データセット統計 総サンプル数: 10,000 言語: 日本語 難易度: 初級(N5-N4相当) 対象: 日本語学習者、言語モデル研究者 タスクタイプ 漢字読み問題 (25%) 例: 「学校」の読み方は? → がっこう 漢字書き問題 (15%) 例: 「みず」を漢字で書いてください → 水 助詞穴埋め問題 (20%) 例: 私_学校_行きます → は、に 助数詞問題 (15%) 例: 3つの本を数えるときの正しい数え方は? → さんさつ 語順並べ替え問題 (10%) 例: 友達と / 公園で / 遊びました → 友達と公園で遊びました 文法問題 (10%) 例:… See the full description on the dataset page: https://huggingface.co/datasets/akira-sasaki/nihongo-dojo-beginner-10k.
017
Update dataset card
Upload Nihongo DoJo beginner Japanese dataset
initial commit
