beyond/chinese_clean_passages_80m
chinese_clean_passages_80m 包含8千余万(88328203)个纯净中文段落,不包含任何字母、数字。Containing more than 80 million pure & clean Chinese passages, without any letters/digits/special tokens. 文本长度大部分介于50~200个汉字之间。The passage length is approximately 50~200 Chinese characters. 通过datasets.load_dataset()下载数据,会产生38个大小约340M的数据包,共约12GB,所以请确保有足够空间。Downloading the dataset will result in 38 data shards each of which is about 340M and 12GB in total. Make sure there's enough space in your device:) >>>… See the full description on the dataset page: https://huggingface.co/datasets/beyond/chinese_clean_passages_80m.
Update README.md
Update README.md
Update README.md
Upload README.md with huggingface_hub
Upload data/train-00037-of-00038-aefa59a14d9967ee.parquet with huggingface_hub
Upload data/train-00036-of-00038-be25292bc434f65a.parquet with huggingface_hub
Upload data/train-00035-of-00038-47e20bf4dab37480.parquet with huggingface_hub
Upload data/train-00034-of-00038-94b31f24ec7d02ef.parquet with huggingface_hub
Upload data/train-00033-of-00038-5b767789120139a9.parquet with huggingface_hub
Upload data/train-00032-of-00038-c7599ab6bdaea863.parquet with huggingface_hub
Upload data/train-00031-of-00038-b191098296f9db8b.parquet with huggingface_hub
Upload data/train-00030-of-00038-bcebc0d17fa21283.parquet with huggingface_hub
Upload data/train-00029-of-00038-01029a3621fe16fb.parquet with huggingface_hub
Upload data/train-00028-of-00038-6bdf9344351662fd.parquet with huggingface_hub
Upload data/train-00027-of-00038-365dc340d9f4eafe.parquet with huggingface_hub
Upload data/train-00026-of-00038-1cb4e3dac2e95026.parquet with huggingface_hub
Upload data/train-00025-of-00038-d91313b0e1c33377.parquet with huggingface_hub
Upload data/train-00024-of-00038-a9f51070d13a152c.parquet with huggingface_hub
Upload data/train-00023-of-00038-e20a3a8e4962fc45.parquet with huggingface_hub
Upload data/train-00022-of-00038-0c46dcb47d06dc8d.parquet with huggingface_hub
Upload data/train-00021-of-00038-11969f15a7db4bb3.parquet with huggingface_hub
Upload data/train-00020-of-00038-5ccf9693123f5f58.parquet with huggingface_hub
Upload data/train-00019-of-00038-4bddb3af5da9737e.parquet with huggingface_hub
Upload data/train-00018-of-00038-e87d9bb5d89f579b.parquet with huggingface_hub
Upload data/train-00017-of-00038-ac0397d15b55f782.parquet with huggingface_hub
Upload data/train-00016-of-00038-6fd9bfcf9698cdaf.parquet with huggingface_hub
Upload data/train-00015-of-00038-248fa353a77fbb6a.parquet with huggingface_hub
Upload data/train-00014-of-00038-2b41276e2a5f4a20.parquet with huggingface_hub
Upload data/train-00013-of-00038-ba78d3863dfeb179.parquet with huggingface_hub
Upload data/train-00012-of-00038-c91b406ba6e1d0ae.parquet with huggingface_hub
Upload data/train-00011-of-00038-2f16e5f1d989c004.parquet with huggingface_hub
Upload data/train-00010-of-00038-10da0d1b83c3d1ea.parquet with huggingface_hub
Upload data/train-00009-of-00038-b3b0a01b217b77c8.parquet with huggingface_hub
Upload data/train-00008-of-00038-7db58dc4d4bdf11c.parquet with huggingface_hub
Upload data/train-00007-of-00038-68b05fd9a0e67fd6.parquet with huggingface_hub
Upload data/train-00006-of-00038-0d0c66c877ab779e.parquet with huggingface_hub
Upload data/train-00005-of-00038-df38e2f4e4d1b1bb.parquet with huggingface_hub
Upload data/train-00004-of-00038-a508e4c19e2366b2.parquet with huggingface_hub
Upload data/train-00003-of-00038-01a65a6ac55eb616.parquet with huggingface_hub
Upload data/train-00002-of-00038-29bf905ab8001443.parquet with huggingface_hub
Upload data/train-00001-of-00038-fa0b1169236cc21a.parquet with huggingface_hub
Upload data/train-00000-of-00038-f7b909e50e10c694.parquet with huggingface_hub
initial commit
