CoolFace
Datasetpublic

YigitCahit/temiz-OSCAR

Dataset Card for Temiz OSCAR Temiz OSCAR is a corpora collection consisting of cleaned versions of original OSCAR corpora. This collection is made up of four datasets: OSCAR-2019, OSCAR-2109, OSCAR-2201 and OSCAR-2301 This corpus is a part of large scale Turkish corpus Bella Turca. For more details about Bella Turca, please refer to the publication. Dataset num instances size num of words OSCAR-2019 3.671.430 7.7G 976M OSCAR-2109 8.472.809 18G 2.22B OSCAR-2201… See the full description on the dataset page: https://huggingface.co/datasets/YigitCahit/temiz-OSCAR.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes26downloads
1 commits on main
49bf23a6mo ago

Duplicate from turkish-nlp-suite/temiz-OSCAR

YigitCahit, BayanDuygu