CoolFace
Datasetpublic

michsethowusu/Code-170k-shona

Dataset Description Code-170k-shona is a groundbreaking dataset containing 176,999 programming conversations, originally sourced from glaiveai/glaive-code-assistant-v2 and translated into Shona, making coding education accessible to Shona speakers. 🌟 Key Features 176,999 high-quality conversations about programming and coding Pure Shona language - democratizing coding education Multi-turn dialogues covering various programming concepts Diverse topics: algorithms… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/Code-170k-shona.

sourceHugging Faceapache-2.0updated 11mo agoView on Hugging Face
7likes36downloads
Dataset Card

Dataset Description

Code-170k-shona is a groundbreaking dataset containing 176,999 programming conversations, originally sourced from glaiveai/glaive-code-assistant-v2 and translated into Shona, making coding education accessible to Shona speakers.

🌟 Key Features

  • β€”176,999 high-quality conversations about programming and coding
  • β€”Pure Shona language - democratizing coding education
  • β€”Multi-turn dialogues covering various programming concepts
  • β€”Diverse topics: algorithms, data structures, debugging, best practices, and more
  • β€”Ready for instruction tuning of Large Language Models

🎯 Use Cases

  • β€”Training Shona-language coding assistants
  • β€”Building educational tools for Shona developers
  • β€”Researching multilingual code generation
  • β€”Creating programming tutorials in Shona
  • β€”Supporting low-resource language AI development

Dataset Structure

Data Fields

  • β€”conversations: A list of conversation turns, where each turn contains:
  • β€”from: The speaker ("human" or "gpt")
  • β€”value: The message content in Shona

Example

python
{
  "conversations": [
    {
      "from": "human",
      "value": "[Question in Shona]"
    },
    {
      "from": "gpt",
      "value": "[Answer in Shona]"
    }
  ]
}

Usage

Loading the Dataset

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("michsethowusu/Code-170k-shona")

# Access training data
train_data = dataset['train']

# Example: Print first conversation
for turn in train_data[0]['conversations']:
    print(f"{turn['from']}: {turn['value']}")

Citation

bibtex
@dataset{code170k_shona,
  title={Code-170k-shona: Programming Conversations in Shona},
  year={2025},
  publisher={Hugging Face},
  url={https://huggingface.co/datasets/michsethowusu/Code-170k-shona}
}

License

This dataset is released under the Apache 2.0 License.


Thank you for using Code-170k-shona to advance programming education in Shona! 🌍✨