saidutta69/Odia-Web-Corpus-v5
Odia Web Corpus v5 The largest and cleanest Odia text corpus to date — 4.16 million deduplicated documents, 7.74 GB. Built by merging and thoroughly cleaning four source collections. Dataset Details Language: Odia (ISO 639-3: or) Format: 28 sharded Parquet files Total Size: 7.74 GB Total Documents: 4,162,804 License: CC-BY-SA-4.0 Cleaning Pipeline Stage Removed Description Deduplication 30.2% Exact MD5 hash match Short lines… See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v5.
Odia Web Corpus v5
<div align="center"> <img src="https://photu.kashyalabanavli.site/racer-is-op.png" alt="RACER IS OP" width="100%"> </div>
<br>
The largest and cleanest Odia text corpus to date — 4.16 million deduplicated documents, 7.74 GB. Built by merging and thoroughly cleaning four source collections.
Dataset Details
- Language: Odia (ISO 639-3:
or) - Format: 28 sharded Parquet files
- Total Size: 7.74 GB
- Total Documents: 4,162,804
- License: CC-BY-SA-4.0
Cleaning Pipeline
Overall reduction: 37.2% (from 6.63M lines, 9.91 GB raw input)
Source Composition
Data Fields
Usage
from datasets import load_dataset
ds = load_dataset("saidutta69/Odia-Web-Corpus-v5", split="train")
print(f"Total documents: {len(ds)}")
print(ds[0]["text"][:200])Citation
@misc{odia-web-corpus-v5,
author = {Sai Dutta},
title = {Odia Web Corpus v5},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v5}}
}