CoolFace
Datasetpublic

Minuri/sinhala-corpus-madlad400

Sinhala Raw Sentences - MADLAD-400 Raw Sinhala sentences extracted and sentence-split from the allenai/MADLAD-400 dataset. This is an intermediate dataset used in the construction of Minuri/diverse_sinhala_dataset. Dataset Structure Column Description text Raw Sinhala sentence source Source identifier (madlad) Split Rows train 7,281,026 Pipeline Position allenai/MADLAD-400 → this repo → Minuri/madlad_cleaned_version… See the full description on the dataset page: https://huggingface.co/datasets/Minuri/sinhala-corpus-madlad400.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes37downloads
17 commits on main
042d2146mo ago

Update README.md

Minuri
ed574b97mo ago

Upload dataset

Minuri
7a1ed367mo ago

Delete data

Minuri
ef07d0f7mo ago

Upload dataset

Minuri
971a0717mo ago

Delete data

Minuri
e8a68d37mo ago

Upload dataset

Minuri
59855c87mo ago

Delete data

Minuri
cf81d6a7mo ago

Upload dataset

Minuri
6552f357mo ago

Delete data

Minuri
334e0337mo ago

Upload dataset

Minuri
138dd907mo ago

Delete data

Minuri
18224d77mo ago

Upload dataset

Minuri
16319ff7mo ago

Delete data

Minuri
d6750837mo ago

Upload dataset

Minuri
b5e7a0b7mo ago

Delete data

Minuri
c2e6e5a7mo ago

Upload dataset

Minuri
03aa7827mo ago

initial commit

Minuri