saidutta69/Odia-Web-Corpus-v3
Odia Web Corpus v3 Third iteration of the Odia web corpus with enhanced deduplication, quality filtering, and standardized Parquet splits for pretraining and evaluation. Dataset Details Language: Odia (ISO 639-3: or) Format: Parquet (columnar, compressed) Splits: train (900K), validation (50K), test (50K) License: CC-BY-SA-4.0 Data Fields Field Type Description text string Cleaned and filtered document text… See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v3.
Odia Web Corpus v3
<div align="center"> <img src="https://photu.kashyalabanavli.site/racer-is-op.png" alt="RACER IS OP" width="100%"> </div>
<br>
Third iteration of the Odia web corpus with enhanced deduplication, quality filtering, and standardized Parquet splits for pretraining and evaluation.
Dataset Details
- Language: Odia (ISO 639-3:
or) - Format: Parquet (columnar, compressed)
- Splits: train (900K), validation (50K), test (50K)
- License: CC-BY-SA-4.0
Data Fields
Usage
from datasets import load_dataset
ds = load_dataset("saidutta69/Odia-Web-Corpus-v3")
print(ds["train"][0]["text"][:200])Citation
@misc{odia-web-corpus-v3,
author = {Sai Dutta},
title = {Odia Web Corpus v3},
year = {2024},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v3}
}