tohoku-nlp/nanochat-jp-pretrain
nanochat-jp-pretrain nanochat の日本語フォーク nanochat-jp で使用する 事前学習用日本語コーパス です. LLM によるクリーニングを施した日本語ウェブテキストと,llm-jp の公開コーパスを混合したものを,nanochat のデータローダがそのまま読める parquet 形式で配布しています. 構成 以下の4つのソースを混合し,全体をシャッフルしています. ソース llm-jp-corpus-v4 の ja_fineweb-2 サブセット(後述の追加データクリーニングを適用) llm-jp-corpus-midtraining-v2 ja/llm-jp-IPT_v0.3.2/ja_general.jsonl.gz llm-jp-corpus-midtraining-v2 ja/llm-jp-IPT_v0.3.2/ja_reasoning.jsonl.gz llm-jp/scaling-data-constrained-llms… See the full description on the dataset page: https://huggingface.co/datasets/tohoku-nlp/nanochat-jp-pretrain.
nanochat-jp-pretrain
nanochat の日本語フォーク nanochat-jp で使用する 事前学習用日本語コーパス です. LLM によるクリーニングを施した日本語ウェブテキストと,llm-jp の公開コーパスを混合したものを,nanochat のデータローダがそのまま読める parquet 形式で配布しています.
構成
以下の4つのソースを混合し,全体をシャッフルしています.
ja_fineweb-2 への追加データクリーニング
ja_fineweb-2 サブセットについては,以下の追加データクリーニングを実施しています.
- 教育的価値による選別: 日本語 ModernBERT ベースの分類器で各文書に 0〜5 の教育度スコアを付与し,スコア3未満の文書を除外
- LLM によるクリーニング: Qwen3.6-35B-A3B で,ナビゲーション・広告・定型ヘッダ等を除去しつつ本文を意味段落ごとの Markdown に整形(原文の内容・文体は保持)
- ドメインフィルタ: LLM のドメイン分類ラベルから蒸留した fastText 分類器で,アダルト・数学に分類された文書を除去
- ルールベースフィルタ: 文書長・改行率・数字/アルファベット比率・句読点の欠落・n-gram 反復・圧縮率・日本語らしさによる品質フィルタ
ライセンス
ライセンスの異なる複数のコーパスを混合しているため,本データセット全体に単一のライセンスは設定していません(other).各文書は元コーパスのライセンスおよび利用条件を引き継ぎます.
注意
ja_fineweb-2由来の文書は LLM により Markdown へ書き換えられているため,原文とは表現が異なります.また,事実性は保証されません.- ウェブ由来のため,フィルタリングを経てもなお不適切な内容や誤情報が含まれる可能性があります.
謝辞
本データセットの構築にあたり,コーパスを公開されている LLM-jp の皆様に感謝申し上げます. また,本プロジェクトの推進にあたり,多方面でご協力を賜りましたTohoku NLP Groupの皆様に心より御礼申し上げます.
