amkyawdev/myanmar-llm-data
Myanmar LLM Data - chat-skill.md A comprehensive Burmese (Myanmar) conversational dataset for training language models. This dataset contains multi-turn conversations covering various domains. Skill Type: Chat/Skill This dataset is part of the combined Myanmar LLM dataset collection: chat-skill.md - Myanmar conversational data, translations, Q&A agent-skill.md - amkyawdev/mm-llm-coder-agent-dataset code-skill.md - amkyawdev/mm-llm-coder-dataset… See the full description on the dataset page: https://huggingface.co/datasets/amkyawdev/myanmar-llm-data.
Myanmar LLM Data - chat-skill.md
A comprehensive Burmese (Myanmar) conversational dataset for training language models. This dataset contains multi-turn conversations covering various domains.
Skill Type: Chat/Skill
This dataset is part of the combined Myanmar LLM dataset collection:
- chat-skill.md - Myanmar conversational data, translations, Q&A
- agent-skill.md - amkyawdev/mm-llm-coder-agent-dataset
- code-skill.md - amkyawdev/mm-llm-coder-dataset
Overview
This dataset contains multi-turn conversations in Burmese and English covering:
- 💻 Coding: Programming conversations (Python, JavaScript, React, etc.)
- 🌐 Translation: English to Burmese translations
- 📚 General: General knowledge Q&A in Burmese
- 👋 Greetings: Burmese greeting phrases
Dataset Statistics
Data Format
{
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "How are you?"},
{"role": "assistant", "content": "I'm doing well, thank you!"}
],
"tags": "greeting"
}Usage
from datasets import load_dataset
dataset = load_dataset("amkyawdev/myanmar-llm-data")
# Access sample
sample = dataset["train"][0]
print("Messages:", sample["messages"])
print("Tags:", sample["tags"])Use Cases
- Fine-tune LLMs: Train models like phi-2, Llama, Mistral
- Chatbots: Build Myanmar conversational AI
- Translation: English ↔ Myanmar translation
- RAG: Build retrieval systems for Myanmar content
License
MIT License
