CoolFace
Datasetpublic

rejauldu/bengali-wikipedia

📚 Bengali Wikipedia Language Modeling Dataset (For GPT-2 Training) 📝 Dataset Summary This dataset contains a large Bengali text corpus collected from Bengali Wikipedia.It is cleaned, sentence-segmented, and formatted for next-token prediction language modeling tasks such as GPT-2 training. It includes train and validation splits, suitable for transformer-based Bengali language models. 📊 Dataset Details Property Value Language Bengali… See the full description on the dataset page: https://huggingface.co/datasets/rejauldu/bengali-wikipedia.

sourceHugging Facecc-by-3.0updated 11mo agoView on Hugging Face
0likes70downloads

rejauldu/bengali-wikipedia · main · files are served by the source, never re-hosted here