CoolFace
Datasetpublic

zmsali/bangla-dialect-normalization

Bangla Dialect Normalization Dataset A parallel corpus mapping standard Bangla to five regional Bangla dialects, built from the Vashantor dataset. Each row contains the same sentence in standard Bangla and Banglish (romanized), alongside its dialect Bangla and dialect Banglish equivalent, plus an English gloss. Regions covered Barishal, Chittagong, Mymensingh, Noakhali, Sylhet Schema Field Description standard_bangla Sentence in standard… See the full description on the dataset page: https://huggingface.co/datasets/zmsali/bangla-dialect-normalization.

sourceHugging Faceapache-2.0updated 22d agoView on Hugging Face
0likes65downloads
Dataset Card

Bangla Dialect Normalization Dataset

A parallel corpus mapping standard Bangla to five regional Bangla dialects, built from the Vashantor dataset. Each row contains the same sentence in standard Bangla and Banglish (romanized), alongside its dialect Bangla and dialect Banglish equivalent, plus an English gloss.

Regions covered

Barishal, Chittagong, Mymensingh, Noakhali, Sylhet

Schema

FieldDescription
standard_banglaSentence in standard Bangla script
standard_banglishSame sentence, romanized
dialect_banglaRegional dialect translation, Bangla script
dialect_banglishRegional dialect translation, romanized
regionDialect region name
englishEnglish gloss of the sentence

Splits

  • train
  • validation
  • test

Intended use

Dialect-aware ASR/NLP training, dialect normalization, and fine-tuning LLMs for Bangladeshi regional dialect understanding.