CoolFace
Datasetpublic

tohoku-nlp/nanochat-jp-pretrain

nanochat-jp-pretrain nanochat の日本語フォーク nanochat-jp で使用する 事前学習用日本語コーパス です. LLM によるクリーニングを施した日本語ウェブテキストと,llm-jp の公開コーパスを混合したものを,nanochat のデータローダがそのまま読める parquet 形式で配布しています. 構成 以下の4つのソースを混合し,全体をシャッフルしています. ソース llm-jp-corpus-v4 の ja_fineweb-2, ja_wiki サブセット(後述の追加データクリーニングを適用) llm-jp-corpus-midtraining-v2 ja/llm-jp-IPT_v0.3.2/ja_general.jsonl.gz llm-jp-corpus-midtraining-v2 ja/llm-jp-IPT_v0.3.2/ja_reasoning.jsonl.gz llm-jp/scaling-data-constrained-llms… See the full description on the dataset page: https://huggingface.co/datasets/tohoku-nlp/nanochat-jp-pretrain.

sourceHugging Faceotherupdated 5h agoView on Hugging Face
0likes281downloads
9 commits on main
0cb02275h ago

Upload README.md with huggingface_hub

shirayukikun
97e05495h ago

Move 106 root Parquet files into v4 directory

shirayukikun
af240405h ago

Upload folder using huggingface_hub

shirayukikun
136bd861mo ago

Upload README.md with huggingface_hub

shirayukikun
d7041fc1mo ago

Upload README.md with huggingface_hub

shirayukikun
cde1fb41mo ago

Upload README.md with huggingface_hub

shirayukikun
39ae8441mo ago

Upload README.md with huggingface_hub

shirayukikun
756c21d1mo ago

Upload folder using huggingface_hub

shirayukikun
03dc5301mo ago

initial commit

shirayukikun