CoolFace
Datasetpublic

Minuri/diverse_sinhala_dataset

Diverse Sinhala Dataset A large-scale, cleaned, deduplicated, and domain-classified Sinhala text corpus compiled for continual pretraining of large language models. Constructed as part of a diversity-driven Sinhala language model adaptation study. This repository serves as pipeline storage for the full corpus construction process, from merged cleaned sentences through to the final high-confidence domain-classified corpus. Files File Rows Columns Description… See the full description on the dataset page: https://huggingface.co/datasets/Minuri/diverse_sinhala_dataset.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes38downloads
12 commits on main
41105856mo ago

Update README.md

Minuri
df6f6906mo ago

Update README.md

Minuri
5989fc56mo ago

Create dataset_info.yaml

Minuri
31243a06mo ago

Upload high_confidence_7_7M.csv with huggingface_hub

Minuri
b7def2a6mo ago

Upload full_dataset_classified.csv with huggingface_hub

Minuri
d21c7fa6mo ago

Delete full_dataset_classified.csv with huggingface_hub

Minuri
80477f06mo ago

Upload full_dataset_classified.csv with huggingface_hub

Minuri
d5541c27mo ago

Upload near_deduplicated_corpus.csv with huggingface_hub

Minuri
1b2788f7mo ago

Upload exact_deduplicated_corpus.csv with huggingface_hub

Minuri
7430b577mo ago

Delete data

Minuri
4529b857mo ago

Upload dataset

Minuri
15e3da77mo ago

initial commit

Minuri