CoolFace
Datasetpublic

amkyawdev/mm-llm-coder-dataset

🇲🇲 Myanmar LLM Coder Dataset (mm-llm-coder-dataset) မြန်မာဘာသာ Coding LLM များ training အတွက် ရည်ရွယ်ထားသော dataset A bilingual (Myanmar + English) coding instruction dataset designed primarily for training Myanmar language Coder LLMs. 🎯 ရည်ရွယ်ချက် / Purpose ဤ dataset သည် မြန်မာဘာသာ programming/coding LLM များ training လုပ်ရန်အတွက် အဓိက ရည်ရွယ်ထားပါသည်။ မြန်မာ developer များ၏ မိခင်ဘာသာစကားဖြင့် coding အကူအညီပေးနိုင်သော AI assistant များကို… See the full description on the dataset page: https://huggingface.co/datasets/amkyawdev/mm-llm-coder-dataset.

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes35downloads
README.md191 linesDownload Raw Back to root
1---2license: apache-2.03language:4- my5- en6task_categories:7- text-generation8- question-answering9tags:10- code11- coding12- myanmar13- burmese14- llm15- instruction-tuning16- conversational17size_categories:18- 1M<n<10M19configs:20- config_name: default21  data_files:22  - split: train23    path: data/train-*24---25 26# 🇲🇲 Myanmar LLM Coder Dataset (mm-llm-coder-dataset)27 28![License](https://img.shields.io/badge/License-Apache--2.0-yellow)29![Rows](https://img.shields.io/badge/Rows-4M-blue)30![Languages](https://img.shields.io/badge/Languages-my%20%7C%20en-green)31![Format](https://img.shields.io/badge/Format-Parquet-orange)32 33> **မြန်မာဘာသာ Coding LLM များ training အတွက် ရည်ရွယ်ထားသော dataset**34>35> A bilingual (Myanmar + English) coding instruction dataset designed primarily for training **Myanmar language Coder LLMs**.36 37---38 39## 🎯 ရည်ရွယ်ချက် / Purpose40 41ဤ dataset သည် **မြန်မာဘာသာ programming/coding LLM** များ training လုပ်ရန်အတွက် အဓိက ရည်ရွယ်ထားပါသည်။ မြန်မာ developer များ၏ မိခင်ဘာသာစကားဖြင့် coding အကူအညီပေးနိုင်သော AI assistant များကို ဖန်တီးနိုင်စေရန် Myanmar (my) နှင့် English (en) ဘာသာစကား နှစ်မျိုးဖြင့် pair training data ထည့်သွင်းထားပါသည်။42 43This dataset is primarily intended for training **Myanmar (Burmese) language Coder LLMs** — enabling AI coding assistants that natively understand and respond in မြန်မာဘာသာ. Both English and Myanmar examples share the same schema for parallel/cross-lingual training.44 45## 📊 Dataset Statistics46 47| Metric | Value |48| --- | --- |49| Total Samples | **4,000,000** |50| Myanmar (my) | 2,000,000 |51| English (en) | 2,000,000 |52| Format | Parquet (Snappy compressed) |53| Files | `data/train-00000-of-00004.parquet` … `data/train-00003-of-00004.parquet` |54| Splits | `train` (single split) |55 56## 🗂️ Schema57 58```python59{60    "instruction": str,          # Topic/title of the Q&A61    "messages": [                # Multi-turn conversation62        {"role": "user", "content": str},63        {"role": "assistant", "content": str},64        ...                      # 2 / 4 / 6 messages per sample65    ],66    "category": str,             # See categories below67    "language": str,             # "my" or "en"68    "difficulty": str,           # "beginner" | "intermediate" | "advanced"69    "response": str,             # JSON-serialized messages (string form)70    "task_type": str,            # "qa_conversation"71}72```73 74### Categories (၉ မျိုး)75 76`code_debugging`, `mongodb_project`, `telegram_bot`, `ui_ux_design`,77`cloudflare_worker`, `deployment_help`, `api_integration`,78`firebase_project`, `website_builder`79 80### Difficulty Levels81 82`beginner` · `intermediate` · `advanced`83 84## 📝 Sample Examples85 86### Myanmar (my)87```json88{89  "instruction": "React useEffect ကို StrictMode မှာ နှစ်ကြိမ် run တာ ဘယ်လိုဖြေရှင်းမလဲ?",90  "messages": [91    {"role": "user", "content": "ကျွန်တော့် useEffect က development မှာ နှစ်ကြိမ် run နေပါတယ်။ ဘာကြောင့်လဲ?"},92    {"role": "assistant", "content": "React 18 StrictMode က side effects တွေကို detect လုပ်ဖို့အတွက် effects တွေကို နှစ်ကြိမ်ခေါ်ပါတယ်။\n\n**ဖြေရှင်းနည်း**: cleanup function ထည့်ပါ..."}93  ],94  "category": "code_debugging",95  "language": "my",96  "difficulty": "beginner",97  "task_type": "qa_conversation"98}99```100 101### English (en)102```json103{104  "instruction": "React useEffect runs twice in StrictMode - how to fix?",105  "messages": [106    {"role": "user", "content": "My useEffect is running twice in development. Why?"},107    {"role": "assistant", "content": "React 18 StrictMode intentionally double-invokes effects to detect side effects..."}108  ],109  "category": "code_debugging",110  "language": "en",111  "difficulty": "beginner",112  "task_type": "qa_conversation"113}114```115 116## 🚀 Usage117 118### Load full dataset119```python120from datasets import load_dataset121 122ds = load_dataset("amkyawdev/mm-llm-coder-dataset")123print(ds)124# DatasetDict({ train: Dataset(num_rows=4000000, ...) })125```126 127### Filter by language128 129```python130# Myanmar only — for Myanmar-focused fine-tuning131my_data = ds["train"].filter(lambda x: x["language"] == "my")132 133# English only — for cross-lingual / parallel training134en_data = ds["train"].filter(lambda x: x["language"] == "en")135```136 137### Filter by category & difficulty138```python139debugging_advanced = ds["train"].filter(140    lambda x: x["category"] == "code_debugging" and x["difficulty"] == "advanced"141)142```143 144### Streaming (recommended for large-scale training)145```python146ds = load_dataset("amkyawdev/mm-llm-coder-dataset", streaming=True)147for sample in ds["train"]:148    print(sample["language"], sample["instruction"])149    break150```151 152## 🎓 Use Cases153 1541. **🇲🇲 Myanmar Coder LLM training** — fine-tune base models (Llama, Qwen, Mistral, etc.) into Myanmar-language coding assistants1552. **Cross-lingual code Q&A** — train models that handle both Myanmar and English coding queries1563. **Instruction tuning** — multi-turn conversation format suitable for chat models1574. **Code debugging assistants** — error fixing patterns across React, Node.js, MongoDB, WebSocket, etc.1585. **Topic-specific fine-tuning** — filter by category (e.g., MongoDB-only, Firebase-only)159 160## 🔗 Related Datasets161 162This dataset is part of the combined Myanmar LLM dataset collection by [@amkyawdev](https://huggingface.co/amkyawdev):163 164- **chat-skill** → [amkyawdev/myanmar-llm-data](https://huggingface.co/datasets/amkyawdev/myanmar-llm-data) — conversational data, translations, general Q&A165- **agent-skill** → [amkyawdev/mm-llm-coder-agent-dataset](https://huggingface.co/datasets/amkyawdev/mm-llm-coder-agent-dataset) — agentic coding tasks166- **code-skill** → **this dataset** — code generation, debugging, and Q&A167 168## ⚠️ Notes / Caveats169 170- The dataset is **template-based**: the 4M samples are produced by combining a curated set of coding instructions with category × difficulty × conversation-length variations. This makes the dataset large and structurally consistent, but with limited semantic diversity per topic.171- For higher-quality, more diverse Myanmar samples, you may consider augmenting with LLM-generated translations of curated English programming Q&A.172- Both `messages` (list) and `response` (JSON string) fields contain the same conversation — use whichever your training pipeline prefers.173 174## 📄 License175 176Apache 2.0177 178## 🙏 Citation179 180If you use this dataset in your work, please cite:181 182```bibtex183@dataset{amkyawdev_mm_llm_coder_2025,184  author    = {amkyawdev},185  title     = {Myanmar LLM Coder Dataset (mm-llm-coder-dataset)},186  year      = {2025},187  publisher = {Hugging Face},188  url       = {https://huggingface.co/datasets/amkyawdev/mm-llm-coder-dataset}189}190```191