rejauldu/bengali-wikipedia
📚 Bengali Wikipedia Language Modeling Dataset (For GPT-2 Training) 📝 Dataset Summary This dataset contains a large Bengali text corpus collected from Bengali Wikipedia.It is cleaned, sentence-segmented, and formatted for next-token prediction language modeling tasks such as GPT-2 training. It includes train and validation splits, suitable for transformer-based Bengali language models. 📊 Dataset Details Property Value Language Bengali… See the full description on the dataset page: https://huggingface.co/datasets/rejauldu/bengali-wikipedia.
070
Update README.md
Update README.md
Update README.md
Update README.md
Upload dataset
initial commit
