CoolFace
Datasetpublic

akira-sasaki/nihongo-dojo-beginner-10k

Nihongo DoJo 初級日本語学習データセット 概要 このデータセットは、日本語学習者向けの合成データセットです。GRPO (Group Relative Policy Optimization) を用いた日本語言語モデルの学習に最適化されています。 データセット統計 総サンプル数: 10,000 言語: 日本語 難易度: 初級(N5-N4相当) 対象: 日本語学習者、言語モデル研究者 タスクタイプ 漢字読み問題 (25%) 例: 「学校」の読み方は? → がっこう 漢字書き問題 (15%) 例: 「みず」を漢字で書いてください → 水 助詞穴埋め問題 (20%) 例: 私_学校_行きます → は、に 助数詞問題 (15%) 例: 3つの本を数えるときの正しい数え方は? → さんさつ 語順並べ替え問題 (10%) 例: 友達と / 公園で / 遊びました → 友達と公園で遊びました 文法問題 (10%) 例:… See the full description on the dataset page: https://huggingface.co/datasets/akira-sasaki/nihongo-dojo-beginner-10k.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes17downloads
discussions and pull requests

Conversations for this repository live on Hugging Face.

CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.

Open discussions on Hugging Face
akira-sasaki/nihongo-dojo-beginner-10k · CoolFace