CoolFace
Datasetpublic

aplycaebous/BanglaTLit

BanglaTLit: A Benchmark Dataset for Back-Transliteration of Romanized Bangla Dataset Overview BanglaTLit-PT: A pre-training corpus with 245727 transliterated or romanized Bangla samples for further pre-training language models. BanglaTLit: Subset of the BanglaTLit-PT dataset containing 42705 romanized Bangla and its corresponding Bangla back-transliteration pairs. Data Description Column Title Description id A unique identifier for… See the full description on the dataset page: https://huggingface.co/datasets/aplycaebous/BanglaTLit.

sourceHugging Facemitupdated 2y agoView on Hugging Face
0likes75downloads
Dataset Card

BanglaTLit: A Benchmark Dataset for Back-Transliteration of Romanized Bangla

![arXiv](https://github.com/farhanishmam/BanglaTLit)

Dataset Overview

  • —BanglaTLit-PT: A pre-training corpus with 245727 transliterated or romanized Bangla samples for further pre-training language models.
  • —BanglaTLit: Subset of the BanglaTLit-PT dataset containing 42705 romanized Bangla and its corresponding Bangla back-transliteration pairs.

Data Description

**Column Title****Description**
idA unique identifier for each data point in the dataset.
text_transliteratedThe transliterated (romanized) Bengali text input that needs to be back-transliterated.
text_bengaliThe corresponding Bengali text that is the correct back-transliteration output.

Summary Statistics

StatisticTransliteratedBack-Transliterated
Mean Character Length59.2458.28
Max Character Length14061347
Min Character Length34
Mean Word Count10.3510.51
Max Word Count212226
Min Word Count22
Unique Word Count8184860644
Unique Sentence Count4270542471