saidutta69/Odia-Web-Corpus-v3
Odia Web Corpus v3 Third iteration of the Odia web corpus with enhanced deduplication, quality filtering, and standardized Parquet splits for pretraining and evaluation. Dataset Details Language: Odia (ISO 639-3: or) Format: Parquet (columnar, compressed) Splits: train (900K), validation (50K), test (50K) License: CC-BY-SA-4.0 Data Fields Field Type Description text string Cleaned and filtered document text… See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/Odia-Web-Corpus-v3.
Use self-hosted banner image
Upload README.md with huggingface_hub
Update banner link in card
Add branded banner image to model/dataset card
Upload README.md with huggingface_hub
Add dataset card
v3 initial release
initial commit
