CoolFace
Datasetpublic

statworx/leipzip-swiss

Dataset Card for Leipzig Corpora Swiss German Dataset Summary Swiss German Wikipedia corpus based on material from 2021.The corpus gsw_wikipedia_2021 is a Swiss German Wikipedia corpus based on material from 2021. It contains 232,933 sentences and 3,824,547 tokens. Languages Swiss-German Dataset Structure Data Instances Single sentences. Data Fields sentence: Text as string. Data Splits… See the full description on the dataset page: https://huggingface.co/datasets/statworx/leipzip-swiss.

sourceHugging Faceccupdated 4y agoView on Hugging Face
2likes17downloads
Dataset Card

Dataset Card for Leipzig Corpora Swiss German

Dataset Description

  • —Homepage: https://wortschatz.uni-leipzig.de/en/download/Swiss%20German
  • —Repository: https://huggingface.co/datasets/statworx/leipzip-swiss

Dataset Summary

Swiss German Wikipedia corpus based on material from 2021. The corpus gswwikipedia2021 is a Swiss German Wikipedia corpus based on material from 2021. It contains 232,933 sentences and 3,824,547 tokens.

Languages

Swiss-German

Dataset Structure

Data Instances

Single sentences.

Data Fields

sentence: Text as string.

Data Splits

[More Information Needed]

Dataset Creation

Source Data

Initial Data Collection and Normalization

https://corpora.uni-leipzig.de/en?corpusId=gswwikipedia2021

Additional Information

Licensing Information

Creative-Commons-Lizenz CC BY-NC

Citation Information

Leipzig Corpora Collection: Swiss German Wikipedia corpus based on material from 2021. Leipzig Corpora Collection. Dataset. https://corpora.uni-leipzig.de?corpusId=gswwikipedia2021