CoolFace
Datasetpublic

Minuri/sinhala-corpus-culturax

Sinhala Raw Sentences - CulturaX Raw Sinhala sentences extracted and sentence-split from the uonlp/CulturaX dataset. This is an intermediate dataset used in the construction of Minuri/diverse_sinhala_dataset. Dataset Structure Column Description text Raw Sinhala sentence source Source identifier (culturax) Split Rows train 4,707,451 Pipeline Position uonlp/CulturaX → this repo → Minuri/culturax_cleaned_version →… See the full description on the dataset page: https://huggingface.co/datasets/Minuri/sinhala-corpus-culturax.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes37downloads
Dataset Card

Sinhala Raw Sentences - CulturaX

Raw Sinhala sentences extracted and sentence-split from the uonlp/CulturaX dataset. This is an intermediate dataset used in the construction of Minuri/diverse_sinhala_dataset.

Dataset Structure

ColumnDescription
textRaw Sinhala sentence
sourceSource identifier (culturax)
SplitRows
train4,707,451

Pipeline Position

uonlp/CulturaX → this repo → Minuri/culturax_cleaned_version → Minuri/diverse_sinhala_dataset

Sources & Licenses

SourceLicense
uonlp/CulturaXmC4 + OSCAR licenses - requires contact info agreement on HuggingFace

Related Repositories

RepoDescription
Minuri/culturax_cleaned_versionCleaned version (3,684,137 sentences)
Minuri/diverse_sinhala_datasetFinal parent corpus