kalixlouiis/myanmar-literature-corpus
မြန်မာ စာပေ Corpus (MYLT Corpus) 🇲🇲📚 ✨ ခြုံငုံဖော်ပြချက် (Overview) ဤ မြန်မာ စာပေ Corpus (MYLT Corpus) သည် မြန်မာဘာသာစကားဖြင့် ရေးသားထားသော စာအုပ်နှင့် ဝတ္ထုရှည်များစွာမှ စာသားများကို စုစည်းသန့်စင်ထားသော အထွေထွေ Corpus ဖြစ်ပါသည်။ အဓိကအားဖြင့် မြန်မာ NLP (Natural Language Processing) နယ်ပယ် တိုးတက်ရေးအတွက်၊ အထူးသဖြင့် Language Model များ၊ Text Generation နှင့် Text Classification စသော လုပ်ငန်းများတွင် သုတေသနပြုရန် ရည်ရွယ်ပါသည်။ 🎯 ရည်ရွယ်ချက်နှင့်… See the full description on the dataset page: https://huggingface.co/datasets/kalixlouiis/myanmar-literature-corpus.
မြန်မာ စာပေ Corpus (MYLT Corpus) 🇲🇲📚
✨ ခြုံငုံဖော်ပြချက် (Overview)
ဤ မြန်မာ စာပေ Corpus (MYLT Corpus) သည် မြန်မာဘာသာစကားဖြင့် ရေးသားထားသော စာအုပ်နှင့် ဝတ္ထုရှည်များစွာမှ စာသားများကို စုစည်းသန့်စင်ထားသော အထွေထွေ Corpus ဖြစ်ပါသည်။ အဓိကအားဖြင့် မြန်မာ NLP (Natural Language Processing) နယ်ပယ် တိုးတက်ရေးအတွက်၊ အထူးသဖြင့် Language Model များ၊ Text Generation နှင့် Text Classification စသော လုပ်ငန်းများတွင် သုတေသနပြုရန် ရည်ရွယ်ပါသည်။
🎯 ရည်ရွယ်ချက်နှင့် အသုံးပြုမှု (Intended Uses)
- အဓိက ရည်ရွယ်ချက်: မြန်မာဘာသာစကားသုံး NLP Model များ၏ စွမ်းဆောင်ရည်ကို မြှင့်တင်ရန်အတွက် သုတေသနနှင့် ပညာရေးဆိုင်ရာ လုပ်ငန်းများတွင် အသုံးပြုရန်။
- ရည်ရွယ်သည့် Tasks များ: Language Modeling (ဥပမာ- BERT, GPT), Text Classification, Sentiment Analysis စသည်တို့။
🛑 မူပိုင်ခွင့်နှင့် အသုံးပြုမှုဆိုင်ရာ သတိပေးချက် (Copyright and Usage Disclaimer)
ဤ Dataset ကို အသုံးပြုသူတိုင်းသည် အောက်ပါ စည်းကမ်းချက်များကို တိကျစွာ လိုက်နာရန် တာဝန်ရှိပါသည်။
1. စီးပွားဖြစ်လုံးဝမသုံးရ (Strictly Non-Commercial - 🚫 NC)
ဤ Dataset၊ သို့မဟုတ် ဤ Dataset မှ လေ့ကျင့်ထားသော Model များအား စီးပွားဖြစ် ရည်ရွယ်ချက် (ငွေကြေးအရ အကျိုးအမြတ်ရယူရန်) အတွက် အသုံးပြုခြင်းကို လုံးဝ တားမြစ်ပါသည်။
2. ခွင့်ပြုချက် လိုအပ်ခြင်း (Permission Required - 🔒)
မူရင်းစာသား အကြောင်းအရာများသည် သက်ဆိုင်ရာ စာရေးဆရာများ၊ ဘာသာပြန်ဆိုသူများနှင့် ထုတ်ဝေသူများ၏ ဉာဏမူပိုင်ခွင့် (Copyright) အောက်တွင် တည်ရှိပါသည်။
- ဤ Dataset ကို သုံးစွဲသူများသည် ၎င်းတို့၏ သုတေသနရလဒ်များ သို့မဟုတ် Model များကို တရားဝင် ထုတ်ဝေခြင်း (Deployment) မပြုမီတွင် မူရင်းစာရေးဆရာ သို့မဟုတ် ထုတ်ဝေသူများထံမှ အသုံးပြုခွင့် (Permission) ကို ကိုယ်တိုင် ရယူရန် လိုအပ်ပါသည်။
- ဤ Repository သည် မူပိုင်ခွင့်ဆိုင်ရာ တာဝန်ယူမှုမရှိဘဲ၊ ပညာရေး သုတေသန ရည်ရွယ်ချက်ဖြင့်သာ စုစည်းထားခြင်း ဖြစ်ပါသည်။
3. ကိုးကားရမည် (Attribution - ✍️ BY)
သုတေသန စာတမ်းများ သို့မဟုတ် Project များတွင် အသုံးပြုပါက မူရင်းစာရေးဆရာ (Author Field) နှင့် ဤ Dataset Repository ကို ရှင်းလင်းစွာ ကိုးကားဖော်ပြရမည်။
📊 Dataset ဖွဲ့စည်းပုံ (Data Structure)
Dataset ကို စာအုပ်အလိုက် JSON Lines (.jsonl) ဖိုင်များအဖြစ် ခွဲခြားထားပြီး၊ အောက်ပါ Fields များ ပါဝင်ပါသည်။
📚 အရင်းအမြစ်စာအုပ်များ (Source Books)
Dataset တွင် ပါဝင်သော စာအုပ်များနှင့် Row အရေအတွက် အသေးစိတ်ကို အောက်တွင် ဖော်ပြထားသည်။
