CoolFace
Datasetpublic

sh4lu-z/Sinhala-Mega-Corpus-v1

Sinhala Mega Corpus v1 Description English: Sinhala Mega Corpus v1 is a large-scale, high-quality merged dataset specifically designed for training Sinhala Large Language Models (LLMs) and Tokenizers. It combines several major open-source datasets into a single, unified format, providing a diverse range of linguistic patterns from web crawls, encyclopedic knowledge, and conversational data. සිංහල: Sinhala Mega Corpus v1 යනු සිංහල Large Language Models (LLM) සහ… See the full description on the dataset page: https://huggingface.co/datasets/sh4lu-z/Sinhala-Mega-Corpus-v1.

sourceHugging Facecc-by-sa-4.0updated 7mo agoView on Hugging Face
0likes24downloads

sh4lu-z/Sinhala-Mega-Corpus-v1 · main · files are served by the source, never re-hosted here