statworx/leipzip-swiss
Dataset Card for Leipzig Corpora Swiss German Dataset Summary Swiss German Wikipedia corpus based on material from 2021.The corpus gsw_wikipedia_2021 is a Swiss German Wikipedia corpus based on material from 2021. It contains 232,933 sentences and 3,824,547 tokens. Languages Swiss-German Dataset Structure Data Instances Single sentences. Data Fields sentence: Text as string. Data Splits… See the full description on the dataset page: https://huggingface.co/datasets/statworx/leipzip-swiss.
Dataset Card for Leipzig Corpora Swiss German
Dataset Description
- Homepage: https://wortschatz.uni-leipzig.de/en/download/Swiss%20German
- Repository: https://huggingface.co/datasets/statworx/leipzip-swiss
Dataset Summary
Swiss German Wikipedia corpus based on material from 2021. The corpus gswwikipedia2021 is a Swiss German Wikipedia corpus based on material from 2021. It contains 232,933 sentences and 3,824,547 tokens.
Languages
Swiss-German
Dataset Structure
Data Instances
Single sentences.
Data Fields
sentence: Text as string.
Data Splits
[More Information Needed]
Dataset Creation
Source Data
Initial Data Collection and Normalization
https://corpora.uni-leipzig.de/en?corpusId=gswwikipedia2021
Additional Information
Licensing Information
Creative-Commons-Lizenz CC BY-NC
Citation Information
Leipzig Corpora Collection: Swiss German Wikipedia corpus based on material from 2021. Leipzig Corpora Collection. Dataset. https://corpora.uni-leipzig.de?corpusId=gswwikipedia2021
