amkyawdev/mm-llm-coder-dataset
đ˛đ˛ Myanmar LLM Coder Dataset (mm-llm-coder-dataset) ááźááşááŹááŹáᏠCoding LLM ááťáŹá¸ training áĄáá˝ááş áááşáá˝ááşááŹá¸ááąáŹ dataset A bilingual (Myanmar + English) coding instruction dataset designed primarily for training Myanmar language Coder LLMs. đŻ áááşáá˝ááşááťááş / Purpose ᤠdataset áááş ááźááşááŹááŹáᏠprogramming/coding LLM ááťáŹá¸ training ááŻááşáááşáĄáá˝ááş áĄááá áááşáá˝ááşááŹá¸ááŤáááşá ááźááşáᏠdeveloper ááťáŹá¸á áááááşááŹááŹá ááŹá¸ááźááˇáş coding áĄáá°áĄááŽááąá¸áááŻááşááąáŹ AI assistant ááťáŹá¸áááŻâŚ See the full description on the dataset page: https://huggingface.co/datasets/amkyawdev/mm-llm-coder-dataset.
1---2license: apache-2.03language:4- my5- en6task_categories:7- text-generation8- question-answering9tags:10- code11- coding12- myanmar13- burmese14- llm15- instruction-tuning16- conversational17size_categories:18- 1M<n<10M19configs:20- config_name: default21 data_files:22 - split: train23 path: data/train-*24---25 26# đ˛đ˛ Myanmar LLM Coder Dataset (mm-llm-coder-dataset)27 2829303132 33> **ááźááşááŹááŹáᏠCoding LLM ááťáŹá¸ training áĄáá˝ááş áááşáá˝ááşááŹá¸ááąáŹ dataset**34>35> A bilingual (Myanmar + English) coding instruction dataset designed primarily for training **Myanmar language Coder LLMs**.36 37---38 39## đŻ áááşáá˝ááşááťááş / Purpose40 41ᤠdataset áááş **ááźááşááŹááŹáᏠprogramming/coding LLM** ááťáŹá¸ training ááŻááşáááşáĄáá˝ááş áĄááá áááşáá˝ááşááŹá¸ááŤáááşá ááźááşáᏠdeveloper ááťáŹá¸á áááááşááŹááŹá
ááŹá¸ááźááˇáş coding áĄáá°áĄááŽááąá¸áááŻááşááąáŹ AI assistant ááťáŹá¸ááᯠáááşááŽá¸áááŻááşá
áąáááş Myanmar (my) áážááˇáş English (en) ááŹááŹá
ááŹá¸ áážá
áşááťááŻá¸ááźááˇáş pair training data áááˇáşáá˝ááşá¸ááŹá¸ááŤáááşá42 43This dataset is primarily intended for training **Myanmar (Burmese) language Coder LLMs** â enabling AI coding assistants that natively understand and respond in ááźááşááŹááŹááŹ. Both English and Myanmar examples share the same schema for parallel/cross-lingual training.44 45## đ Dataset Statistics46 47| Metric | Value |48| --- | --- |49| Total Samples | **4,000,000** |50| Myanmar (my) | 2,000,000 |51| English (en) | 2,000,000 |52| Format | Parquet (Snappy compressed) |53| Files | `data/train-00000-of-00004.parquet` ⌠`data/train-00003-of-00004.parquet` |54| Splits | `train` (single split) |55 56## đď¸ Schema57 58```python59{60 "instruction": str, # Topic/title of the Q&A61 "messages": [ # Multi-turn conversation62 {"role": "user", "content": str},63 {"role": "assistant", "content": str},64 ... # 2 / 4 / 6 messages per sample65 ],66 "category": str, # See categories below67 "language": str, # "my" or "en"68 "difficulty": str, # "beginner" | "intermediate" | "advanced"69 "response": str, # JSON-serialized messages (string form)70 "task_type": str, # "qa_conversation"71}72```73 74### Categories (á ááťááŻá¸)75 76`code_debugging`, `mongodb_project`, `telegram_bot`, `ui_ux_design`,77`cloudflare_worker`, `deployment_help`, `api_integration`,78`firebase_project`, `website_builder`79 80### Difficulty Levels81 82`beginner` ¡ `intermediate` ¡ `advanced`83 84## đ Sample Examples85 86### Myanmar (my)87```json88{89 "instruction": "React useEffect ááᯠStrictMode áážáŹ áážá
áşááźáááş run áᏠáááşáááŻááźáąáážááşá¸ááá˛?",90 "messages": [91 {"role": "user", "content": "ááťá˝ááşááąáŹáˇáş useEffect á development áážáŹ áážá
áşááźáááş run ááąááŤáááşá ááŹááźáąáŹááˇáşáá˛?"},92 {"role": "assistant", "content": "React 18 StrictMode á side effects áá˝áąááᯠdetect ááŻááşáááŻáˇáĄáá˝ááş effects áá˝áąááᯠáážá
áşááźáááşááąáŤáşááŤáááşá\n\n**ááźáąáážááşá¸áááşá¸**: cleanup function áááˇáşááŤ..."}93 ],94 "category": "code_debugging",95 "language": "my",96 "difficulty": "beginner",97 "task_type": "qa_conversation"98}99```100 101### English (en)102```json103{104 "instruction": "React useEffect runs twice in StrictMode - how to fix?",105 "messages": [106 {"role": "user", "content": "My useEffect is running twice in development. Why?"},107 {"role": "assistant", "content": "React 18 StrictMode intentionally double-invokes effects to detect side effects..."}108 ],109 "category": "code_debugging",110 "language": "en",111 "difficulty": "beginner",112 "task_type": "qa_conversation"113}114```115 116## đ Usage117 118### Load full dataset119```python120from datasets import load_dataset121 122ds = load_dataset("amkyawdev/mm-llm-coder-dataset")123print(ds)124# DatasetDict({ train: Dataset(num_rows=4000000, ...) })125```126 127### Filter by language128 129```python130# Myanmar only â for Myanmar-focused fine-tuning131my_data = ds["train"].filter(lambda x: x["language"] == "my")132 133# English only â for cross-lingual / parallel training134en_data = ds["train"].filter(lambda x: x["language"] == "en")135```136 137### Filter by category & difficulty138```python139debugging_advanced = ds["train"].filter(140 lambda x: x["category"] == "code_debugging" and x["difficulty"] == "advanced"141)142```143 144### Streaming (recommended for large-scale training)145```python146ds = load_dataset("amkyawdev/mm-llm-coder-dataset", streaming=True)147for sample in ds["train"]:148 print(sample["language"], sample["instruction"])149 break150```151 152## đ Use Cases153 1541. **đ˛đ˛ Myanmar Coder LLM training** â fine-tune base models (Llama, Qwen, Mistral, etc.) into Myanmar-language coding assistants1552. **Cross-lingual code Q&A** â train models that handle both Myanmar and English coding queries1563. **Instruction tuning** â multi-turn conversation format suitable for chat models1574. **Code debugging assistants** â error fixing patterns across React, Node.js, MongoDB, WebSocket, etc.1585. **Topic-specific fine-tuning** â filter by category (e.g., MongoDB-only, Firebase-only)159 160## đ Related Datasets161 162This dataset is part of the combined Myanmar LLM dataset collection by [@amkyawdev](https://huggingface.co/amkyawdev):163 164- **chat-skill** â [amkyawdev/myanmar-llm-data](https://huggingface.co/datasets/amkyawdev/myanmar-llm-data) â conversational data, translations, general Q&A165- **agent-skill** â [amkyawdev/mm-llm-coder-agent-dataset](https://huggingface.co/datasets/amkyawdev/mm-llm-coder-agent-dataset) â agentic coding tasks166- **code-skill** â **this dataset** â code generation, debugging, and Q&A167 168## â ď¸ Notes / Caveats169 170- The dataset is **template-based**: the 4M samples are produced by combining a curated set of coding instructions with category Ă difficulty Ă conversation-length variations. This makes the dataset large and structurally consistent, but with limited semantic diversity per topic.171- For higher-quality, more diverse Myanmar samples, you may consider augmenting with LLM-generated translations of curated English programming Q&A.172- Both `messages` (list) and `response` (JSON string) fields contain the same conversation â use whichever your training pipeline prefers.173 174## đ License175 176Apache 2.0177 178## đ Citation179 180If you use this dataset in your work, please cite:181 182```bibtex183@dataset{amkyawdev_mm_llm_coder_2025,184 author = {amkyawdev},185 title = {Myanmar LLM Coder Dataset (mm-llm-coder-dataset)},186 year = {2025},187 publisher = {Hugging Face},188 url = {https://huggingface.co/datasets/amkyawdev/mm-llm-coder-dataset}189}190```191 