CoolFace
Datasetpublic

zmsali/bangla-dialect-normalization

Bangla Dialect Normalization Dataset A parallel corpus mapping standard Bangla to five regional Bangla dialects, built from the Vashantor dataset. Each row contains the same sentence in standard Bangla and Banglish (romanized), alongside its dialect Bangla and dialect Banglish equivalent, plus an English gloss. Regions covered Barishal, Chittagong, Mymensingh, Noakhali, Sylhet Schema Field Description standard_bangla Sentence in standard… See the full description on the dataset page: https://huggingface.co/datasets/zmsali/bangla-dialect-normalization.

sourceHugging Faceapache-2.0updated 25d agoView on Hugging Face
0likes70downloads
README.md48 linesDownload Raw Back to root
1---2language:3- bn4license: apache-2.05task_categories:6- translation7- text2text-generation8pretty_name: Bangla Dialect Normalization9configs:10- config_name: default11  data_files:12  - split: train13    path: train.jsonl14  - split: validation15    path: validation.jsonl16  - split: test17    path: test.jsonl18---19 20# Bangla Dialect Normalization Dataset21 22A parallel corpus mapping standard Bangla to five regional Bangla dialects,23built from the Vashantor dataset. Each row contains the same sentence in24standard Bangla and Banglish (romanized), alongside its dialect Bangla and25dialect Banglish equivalent, plus an English gloss.26 27## Regions covered28Barishal, Chittagong, Mymensingh, Noakhali, Sylhet29 30## Schema31 32| Field | Description |33|---|---|34| `standard_bangla` | Sentence in standard Bangla script |35| `standard_banglish` | Same sentence, romanized |36| `dialect_bangla` | Regional dialect translation, Bangla script |37| `dialect_banglish` | Regional dialect translation, romanized |38| `region` | Dialect region name |39| `english` | English gloss of the sentence |40 41## Splits42- `train`43- `validation`44- `test`45 46## Intended use47Dialect-aware ASR/NLP training, dialect normalization, and fine-tuning48LLMs for Bangladeshi regional dialect understanding.