CoolFace
20 results

Odia

sam2ai /TTS_ODIAaudio100K<n<1M0 likes414 downloads1y agoHugging FaceSPRINGLab /SPRING_INX_Odia_R1audio10K<n<100K1 likes375 downloads2y agoHugging Facesaidutta69 /Odia-Web-Corpus-v5 Odia Web Corpus v5 The largest and cleanest Odia text corpus to date — 4.16 million deduplicated documents, 7.74 GB. Built by merging and thoroughly cleaning four source collections. Dataset Details Language: Odia (ISO 639-3: or) Format: 28 sharded Parquet files Total Size: 7.74 GB Total Documents: 4,162,804 License: CC-BY-SA-4.0 Cleaning Pipeline Stage Removed Description Deduplication 30.2% Exact MD5 hash match Short lines… See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v5.texttext-generation1M<n<10M0 likes287 downloads12d agoHugging Facesaidutta69 /odia_pretrain_dataset_v2 Odia Pretrain Dataset v2 12.3 million clean Odia documents. 30+ sources. Zero noise. Zero gating. Just data that actually works for pretraining. The Origin Story (a.k.a. The Time We Filtered 98% of a Clean Dataset and Learned Our Lesson) v1 was built from spite. v2 was built from more data. We took v1 (25+ sources, 10.3M rows) as the foundation and asked: what else can we add? monsoon-nlp/odia-cleaned -- fully deduplicated against v1 (0 new rows)… See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/odia_pretrain_dataset_v2.texttext-generation10M<n<100M0 likes211 downloads12d agoHugging FaceShivRamSaud /HINDI-BENGALI-MALAYALAM-ODIA-VISUAL-GENOMEimage10K<n<100K0 likes138 downloads18d agoHugging FaceAtharvImmverse /odia_tokenizer_texttext10M<n<100M0 likes130 downloads2mo agoHugging Face