CoolFace
Datasetpublic

rejauldu/bengali-wikipedia

📚 Bengali Wikipedia Language Modeling Dataset (For GPT-2 Training) 📝 Dataset Summary This dataset contains a large Bengali text corpus collected from Bengali Wikipedia.It is cleaned, sentence-segmented, and formatted for next-token prediction language modeling tasks such as GPT-2 training. It includes train and validation splits, suitable for transformer-based Bengali language models. 📊 Dataset Details Property Value Language Bengali… See the full description on the dataset page: https://huggingface.co/datasets/rejauldu/bengali-wikipedia.

sourceHugging Facecc-by-3.0updated 11mo agoView on Hugging Face
0likes70downloads
6 commits on main
f71fd5511mo ago

Update README.md

rejauldu
0f2851f11mo ago

Update README.md

rejauldu
cba146c11mo ago

Update README.md

rejauldu
822a4b011mo ago

Update README.md

rejauldu
0de5a6011mo ago

Upload dataset

rejauldu
eccc5ee11mo ago

initial commit

rejauldu