statworx/leipzip-swiss
Dataset Card for Leipzig Corpora Swiss German Dataset Summary Swiss German Wikipedia corpus based on material from 2021.The corpus gsw_wikipedia_2021 is a Swiss German Wikipedia corpus based on material from 2021. It contains 232,933 sentences and 3,824,547 tokens. Languages Swiss-German Dataset Structure Data Instances Single sentences. Data Fields sentence: Text as string. Data Splits… See the full description on the dataset page: https://huggingface.co/datasets/statworx/leipzip-swiss.
Update README.md
Upload README.md
Upload README.md with huggingface_hub
Delete data/train-00000-of-00001-e0d4961569c52e69.parquet with huggingface_hub
Upload data/train-00000-of-00001-0d60107f007bed33.parquet with huggingface_hub
Upload README.md with huggingface_hub
Delete data/train-00000-of-00001-0d60107f007bed33.parquet with huggingface_hub
Upload data/train-00000-of-00001-e0d4961569c52e69.parquet with huggingface_hub
Upload README.md with huggingface_hub
Delete data/train-00000-of-00001-351f887adb0d40c6.parquet with huggingface_hub
Upload data/train-00000-of-00001-0d60107f007bed33.parquet with huggingface_hub
Upload README.md with huggingface_hub
Upload data/train-00000-of-00001-351f887adb0d40c6.parquet with huggingface_hub
initial commit
