CoolFace
Datasetpublic

hf-test/sv_corpora_parliament_processed

Swedish text corpus created by extracting the "text" from dataset = load_dataset("europarl_bilingual", lang1="en", lang2="sv", split="train") and processing it with: import re def extract_text(batch): text = batch["translation"]["sv"] batch["text"] = re.sub(chars_to_ignore_regex, "", text.lower()) return batch

sourceHugging Faceupdated 5y agoView on Hugging Face
1likes43downloads
6 commits on main
b02c5835y ago

Create README.md

patrickvonplaten
6b4e6665y ago

Upload dataset_infos.json

hf-test
3613bb85y ago

Upload data/train-00000-of-00001.parquet with git-lfs

hf-test
ce2283a5y ago

Upload dataset_infos.json

hf-test
eb532515y ago

Upload data/train-00000-of-00001.parquet with git-lfs

hf-test
f9d6dfc5y ago

initial commit

system