CoolFace
Datasetpublic

CausalNLP/clt-tokenized-control-ar-zh-ko-ja-100m

Balanced Arabic-Chinese-Korean-Japanese 4B-token training data Sequential FineWeb-2 documents tokenized with CausalNLP/gpt2-tokenizer-ar-zh-ko-ja. Each language contains at least 100,000,000 tokens in complete documents. Total target: 400,000,000 tokens. Approximately 100,000,000 tokens per Parquet shard. Splits: arb_Arab, cmn_Hani, kor_Hang, jpn_Jpan. Schema: text: string, input_ids: list<int32>.

sourceHugging Faceodc-byupdated 3mo agoView on Hugging Face
0likes31downloads
7 commits on main
cd7e9cc3mo ago

Add arb_Arab shard 00000

abir-hr196
b2f62613mo ago

Add kor_Hang shard 00000

abir-hr196
1cbcf9b3mo ago

Add jpn_Jpan shard 00000

abir-hr196
88d72583mo ago

Add cmn_Hani shard 00000

abir-hr196
a02ae4d3mo ago

Upload generation_config.json with huggingface_hub

abir-hr196
108afcf3mo ago

Upload README.md with huggingface_hub

abir-hr196
cd49b1e3mo ago

initial commit

abir-hr196