CoolFace
Datasetpublic

rejauldu/bengali-wikipedia

📚 Bengali Wikipedia Language Modeling Dataset (For GPT-2 Training) 📝 Dataset Summary This dataset contains a large Bengali text corpus collected from Bengali Wikipedia.It is cleaned, sentence-segmented, and formatted for next-token prediction language modeling tasks such as GPT-2 training. It includes train and validation splits, suitable for transformer-based Bengali language models. 📊 Dataset Details Property Value Language Bengali… See the full description on the dataset page: https://huggingface.co/datasets/rejauldu/bengali-wikipedia.

sourceHugging Facecc-by-3.0updated 11mo agoView on Hugging Face
0likes70downloads
settings

This repository belongs to rejauldu on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namebengali-wikipedia
visibilitypublic
licencecc-by-3.0
gatedno
ownerrejauldu
Account settings
rejauldu/bengali-wikipedia · CoolFace