CoolFace
Datasetpublic

alayaran/bodo-monolingual-dataset

# First Install datasets library pip install datasets from datasets import load_dataset train = load_dataset("alayaran/bodo-monolingual-dataset", "unshuffled_deduplicated_no", split="train") test = load_dataset("alayaran/bodo-monolingual-dataset", "unshuffled_deduplicated_no", split="test") # print the first five entries from the dataset array of trai and test set print(train['text'][:5]) ["मदि सरकारा जारिमिनारि हाबाफारि मावफूंदों , 1 कौटि नख'राव दैनि कानेक्सन होबाय", "दिल्ली / जयपुर… See the full description on the dataset page: https://huggingface.co/datasets/alayaran/bodo-monolingual-dataset.

sourceHugging Facemitupdated 3y agoView on Hugging Face
2likes71downloads
Dataset Card
# First Install datasets library

pip install datasets


from datasets import load_dataset

train = load_dataset("alayaran/bodo-monolingual-dataset", "unshuffled_deduplicated_no", split="train")
test = load_dataset("alayaran/bodo-monolingual-dataset", "unshuffled_deduplicated_no", split="test")

# print the first five entries from the dataset array of trai and test set
print(train['text'][:5])
["मदि सरकारा जारिमिनारि हाबाफारि मावफूंदों ,  1  कौटि नख'राव दैनि कानेक्सन होबाय",
"दिल्ली / जयपुर ,  14  आगस्ट : गाहाय मन्थ्रि नरेन्द्र मदिनि नख'रफ्रोमबो दैनि सिमांखौ जाफुहोनो थाखाय मिरुआरि दै बिफाना बोसोरसेनि खम समावनो
1  कौटि नख'रफोराव लोंग्रा दैनि कानेक्सन होनानै जारिमिनारि खामानि मावबाय ।", "करना बेरामनि गेजेरजोंबो दै बिफाना हादतनि  1  कौटि नख'रफोरखौ नलि कानेक्सनजों सरजाबनाय ।",
'अदेबानि मिरुआरि दै मन्थ्रि गजेन्द्र सिं शेखावतआ खौरां होनाय बायदिब्ला खम समनि गेजेराव एसेबां गिदिर जाफुसारनाया गासै राइज्योफोर आरो मिरुजों खुंजानाय राइज्योफोरनि गेजेरजों नाजानायखौ फोरमायो ।',
"बेनि गेजेरजों थांनाय बृहस्पतिबारखालि शेखावतआ बु़ङोदि , आनलक -  1  जागायजेन्नायनिफ्राय बिसोर सानफ्रोमबो  1  लाखनिक्रुइ बांसिन नख'रफोरनो नलि कानेक्शन होगासिनो दङ ।"]

print(test['text'][:5])
['श्बयम बिथांखिनि सिङाव राइज्योनि सा  2  लाख लाइमोनफोरनो राइज्यो सरकारआ  50  रोजा रां होगोनः हिमन्त',
"गुवाहाटी ,  5  सेप्तेम्बर :  2017  -  2018  माइथायनि बाजेटआव फोसावनाय जादोंमोन स्वामी बिबेकानन्द आसाम इयुथ इम्पावारमेन्ट यजना सुंद'यै श्बयमखौ ।",
'बे बिथांखिखौ फिन फोथांफिन्नो सरकारआ बे समाव गोनांथार राहा लादों ।', 'जायनि थाखाय बे बिथांखिनि मुडाव आसाम सरकारआ गासै  1000  कौटि रां बाहायगोन ।',
'बे बिथांखिनि सिङाव राइज्योनि सा  2  लाख सेंग्रा - सिख्ला लाइमोनफोरनो नोगोद  50  रोजा रां होनायनि हाबाफारि लादों ।']

Use with training scripts

In order to use this dataset along with other models you can use as the following

# cd transformers/examples/pytorch/language-modelling
python run_mlm.py \
    --output_dir="./bodo-roberta-base" \
    --model_type="roberta" \
    --do_train \
    --do_eval \
    --config_name="alayaran/bodo-roberta-base" \
    --tokenizer_name="alayaran/bodo-roberta-base" \
    --dataset_name="alayaran/bodo-monolingual-dataset" \ # <--- This is the dataset
    --max_seq_length="128" \
    --weight_decay="0.01" \
    --per_device_train_batch_size="128" \
    --per_device_eval_batch_size="128" \
    --learning_rate="3e-4" \
    --warmup_steps="1000" \
    --overwrite_output_dir \
    --num_train_epochs="18" \
    --adam_beta1="0.9" \
    --adam_beta2="0.98" \
    --logging_steps="500" \
    --save_steps="2500" \
    --eval_steps="2500" \
    --push_to_hub

Ownership

I do not claim any ownership of the data shared here. The data is mostly from TDIL, and some texts are crawled using Bodo News Crawlers. All copyrights belong to the respective owners. This data is shared for research purposes only.