CoolFace
Datasetpublic

kalixlouiis/myanmar-literature-corpus

မြန်မာ စာပေ Corpus (MYLT Corpus) 🇲🇲📚 ✨ ခြုံငုံဖော်ပြချက် (Overview) ဤ မြန်မာ စာပေ Corpus (MYLT Corpus) သည် မြန်မာဘာသာစကားဖြင့် ရေးသားထားသော စာအုပ်နှင့် ဝတ္ထုရှည်များစွာမှ စာသားများကို စုစည်းသန့်စင်ထားသော အထွေထွေ Corpus ဖြစ်ပါသည်။ အဓိကအားဖြင့် မြန်မာ NLP (Natural Language Processing) နယ်ပယ် တိုးတက်ရေးအတွက်၊ အထူးသဖြင့် Language Model များ၊ Text Generation နှင့် Text Classification စသော လုပ်ငန်းများတွင် သုတေသနပြုရန် ရည်ရွယ်ပါသည်။ 🎯 ရည်ရွယ်ချက်နှင့်… See the full description on the dataset page: https://huggingface.co/datasets/kalixlouiis/myanmar-literature-corpus.

sourceHugging Facecc-by-nc-nd-4.0updated 11mo agoView on Hugging Face
11likes49downloads
Dataset Card

မြန်မာ စာပေ Corpus (MYLT Corpus) 🇲🇲📚

✨ ခြုံငုံဖော်ပြချက် (Overview)

ဤ မြန်မာ စာပေ Corpus (MYLT Corpus) သည် မြန်မာဘာသာစကားဖြင့် ရေးသားထားသော စာအုပ်နှင့် ဝတ္ထုရှည်များစွာမှ စာသားများကို စုစည်းသန့်စင်ထားသော အထွေထွေ Corpus ဖြစ်ပါသည်။ အဓိကအားဖြင့် မြန်မာ NLP (Natural Language Processing) နယ်ပယ် တိုးတက်ရေးအတွက်၊ အထူးသဖြင့် Language Model များ၊ Text Generation နှင့် Text Classification စသော လုပ်ငန်းများတွင် သုတေသနပြုရန် ရည်ရွယ်ပါသည်။

🎯 ရည်ရွယ်ချက်နှင့် အသုံးပြုမှု (Intended Uses)

  • —အဓိက ရည်ရွယ်ချက်: မြန်မာဘာသာစကားသုံး NLP Model များ၏ စွမ်းဆောင်ရည်ကို မြှင့်တင်ရန်အတွက် သုတေသနနှင့် ပညာရေးဆိုင်ရာ လုပ်ငန်းများတွင် အသုံးပြုရန်။
  • —ရည်ရွယ်သည့် Tasks များ: Language Modeling (ဥပမာ- BERT, GPT), Text Classification, Sentiment Analysis စသည်တို့။

🛑 မူပိုင်ခွင့်နှင့် အသုံးပြုမှုဆိုင်ရာ သတိပေးချက် (Copyright and Usage Disclaimer)

ဤ Dataset ကို အသုံးပြုသူတိုင်းသည် အောက်ပါ စည်းကမ်းချက်များကို တိကျစွာ လိုက်နာရန် တာဝန်ရှိပါသည်။

1. စီးပွားဖြစ်လုံးဝမသုံးရ (Strictly Non-Commercial - 🚫 NC)

ဤ Dataset၊ သို့မဟုတ် ဤ Dataset မှ လေ့ကျင့်ထားသော Model များအား စီးပွားဖြစ် ရည်ရွယ်ချက် (ငွေကြေးအရ အကျိုးအမြတ်ရယူရန်) အတွက် အသုံးပြုခြင်းကို လုံးဝ တားမြစ်ပါသည်။

2. ခွင့်ပြုချက် လိုအပ်ခြင်း (Permission Required - 🔒)

မူရင်းစာသား အကြောင်းအရာများသည် သက်ဆိုင်ရာ စာရေးဆရာများ၊ ဘာသာပြန်ဆိုသူများနှင့် ထုတ်ဝေသူများ၏ ဉာဏမူပိုင်ခွင့် (Copyright) အောက်တွင် တည်ရှိပါသည်။

  • —ဤ Dataset ကို သုံးစွဲသူများသည် ၎င်းတို့၏ သုတေသနရလဒ်များ သို့မဟုတ် Model များကို တရားဝင် ထုတ်ဝေခြင်း (Deployment) မပြုမီတွင် မူရင်းစာရေးဆရာ သို့မဟုတ် ထုတ်ဝေသူများထံမှ အသုံးပြုခွင့် (Permission) ကို ကိုယ်တိုင် ရယူရန် လိုအပ်ပါသည်။
  • —ဤ Repository သည် မူပိုင်ခွင့်ဆိုင်ရာ တာဝန်ယူမှုမရှိဘဲ၊ ပညာရေး သုတေသန ရည်ရွယ်ချက်ဖြင့်သာ စုစည်းထားခြင်း ဖြစ်ပါသည်။

3. ကိုးကားရမည် (Attribution - ✍️ BY)

သုတေသန စာတမ်းများ သို့မဟုတ် Project များတွင် အသုံးပြုပါက မူရင်းစာရေးဆရာ (Author Field) နှင့် ဤ Dataset Repository ကို ရှင်းလင်းစွာ ကိုးကားဖော်ပြရမည်။

📊 Dataset ဖွဲ့စည်းပုံ (Data Structure)

Dataset ကို စာအုပ်အလိုက် JSON Lines (.jsonl) ဖိုင်များအဖြစ် ခွဲခြားထားပြီး၊ အောက်ပါ Fields များ ပါဝင်ပါသည်။

Field Nameဖော်ပြချက်
textသန့်စင်ပြီး ဝါကျတစ်ကြောင်း (မြန်မာစာ)။
authorမူရင်းစာရေးဆရာ/ဘာသာပြန်သူ အမည်။
book_titleမူရင်းစာအုပ်အမည်။

📚 အရင်းအမြစ်စာအုပ်များ (Source Books)

Dataset တွင် ပါဝင်သော စာအုပ်များနှင့် Row အရေအတွက် အသေးစိတ်ကို ‌အောက်တွင် ဖော်ပြထားသည်။