CoolFace
Datasetpublic

istiaqfuad/bangla-english-banglish-pairs

Bangla-English-Banglish Trilingual Pairs Overview This dataset provides contrastive training pairs for fine-tuning trilingual (Bangla / Banglish / English) sentence embedding models (such as BGE-M3). It is designed to impart robustness to Banglish spelling variation. The dataset is combined from two main sources: LLM-generated Banglish spelling variants. The OPUS-100 EN-BN parallel corpus. Included Files File Rows Size Description… See the full description on the dataset page: https://huggingface.co/datasets/istiaqfuad/bangla-english-banglish-pairs.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes52downloads
settings

This repository belongs to istiaqfuad on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namebangla-english-banglish-pairs
visibilitypublic
licencecc-by-4.0
gatedno
owneristiaqfuad
Account settings
istiaqfuad/bangla-english-banglish-pairs · CoolFace