CoolFace
Datasetpublic

Minuri/sinhala-corpus-culturax

Sinhala Raw Sentences - CulturaX Raw Sinhala sentences extracted and sentence-split from the uonlp/CulturaX dataset. This is an intermediate dataset used in the construction of Minuri/diverse_sinhala_dataset. Dataset Structure Column Description text Raw Sinhala sentence source Source identifier (culturax) Split Rows train 4,707,451 Pipeline Position uonlp/CulturaX → this repo → Minuri/culturax_cleaned_version →… See the full description on the dataset page: https://huggingface.co/datasets/Minuri/sinhala-corpus-culturax.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes37downloads
15 commits on main
bc0be216mo ago

Update README.md

Minuri
824d48a7mo ago

Upload dataset

Minuri
712c0897mo ago

Delete data

Minuri
e468f5a7mo ago

Upload dataset

Minuri
3d549967mo ago

Delete data

Minuri
c051e787mo ago

Upload dataset

Minuri
199bda77mo ago

Delete data

Minuri
3fa8dbc7mo ago

Upload dataset

Minuri
8784a5a7mo ago

Delete data

Minuri
b6667847mo ago

Upload dataset

Minuri
c2bd4bd7mo ago

Delete data

Minuri
ef90a397mo ago

Upload dataset

Minuri
3909d057mo ago

Delete data

Minuri
063830a7mo ago

Upload dataset

Minuri
493847c7mo ago

initial commit

Minuri