zmsali/bangla-dialect-normalization
Bangla Dialect Normalization Dataset A parallel corpus mapping standard Bangla to five regional Bangla dialects, built from the Vashantor dataset. Each row contains the same sentence in standard Bangla and Banglish (romanized), alongside its dialect Bangla and dialect Banglish equivalent, plus an English gloss. Regions covered Barishal, Chittagong, Mymensingh, Noakhali, Sylhet Schema Field Description standard_bangla Sentence in standard… See the full description on the dataset page: https://huggingface.co/datasets/zmsali/bangla-dialect-normalization.
070
1---2language:3- bn4license: apache-2.05task_categories:6- translation7- text2text-generation8pretty_name: Bangla Dialect Normalization9configs:10- config_name: default11 data_files:12 - split: train13 path: train.jsonl14 - split: validation15 path: validation.jsonl16 - split: test17 path: test.jsonl18---19 20# Bangla Dialect Normalization Dataset21 22A parallel corpus mapping standard Bangla to five regional Bangla dialects,23built from the Vashantor dataset. Each row contains the same sentence in24standard Bangla and Banglish (romanized), alongside its dialect Bangla and25dialect Banglish equivalent, plus an English gloss.26 27## Regions covered28Barishal, Chittagong, Mymensingh, Noakhali, Sylhet29 30## Schema31 32| Field | Description |33|---|---|34| `standard_bangla` | Sentence in standard Bangla script |35| `standard_banglish` | Same sentence, romanized |36| `dialect_bangla` | Regional dialect translation, Bangla script |37| `dialect_banglish` | Regional dialect translation, romanized |38| `region` | Dialect region name |39| `english` | English gloss of the sentence |40 41## Splits42- `train`43- `validation`44- `test`45 46## Intended use47Dialect-aware ASR/NLP training, dialect normalization, and fine-tuning48LLMs for Bangladeshi regional dialect understanding.