nassimjp/qwopus-pashto-reasoning-sft
🚀 Qwopus Pashto Reasoning SFT Dataset د پښتو AI لپاره د استدلال ډیټاسیټ 🌟 د پښتو ژبې لپاره تر ټولو لوی او کیفیت لرونکی Reasoning SFT ډیټاسیټThe largest and highest-quality Reasoning SFT Dataset for the Pashto Language This is a meticulously curated, high-quality Supervised Fine-Tuning (SFT) dataset tailored specifically for training Pashto Natural Language Processing (NLP) models with deep reasoning, mathematical, logical, and structural capabilities.… See the full description on the dataset page: https://huggingface.co/datasets/nassimjp/qwopus-pashto-reasoning-sft.
🚀 Qwopus Pashto Reasoning SFT Dataset
د پښتو AI لپاره د استدلال ډیټاسیټ
     
🌟 د پښتو ژبې لپاره تر ټولو لوی او کیفیت لرونکی Reasoning SFT ډیټاسیټ The largest and highest-quality Reasoning SFT Dataset for the Pashto Language
This is a meticulously curated, high-quality Supervised Fine-Tuning (SFT) dataset tailored specifically for training Pashto Natural Language Processing (NLP) models with deep reasoning, mathematical, logical, and structural capabilities.
The dataset contains a carefully processed mix of interactive human-assistant dialogues, optimized for high token fidelity and cultural/linguistic alignment.
🎯 Why This Dataset Matters for Pashto AI
📊 Dataset Summary
🔥 Viral Features That Make This Dataset Special
1. 🌐 First-of-its-kind for Pashto
The largest publicly available reasoning dataset for Pashto NLP. No competition at this scale!
2. 🧠 Deep Reasoning, Not Just Translation
Unlike simple translation datasets, ours preserves:
- Step-by-step logical deduction
- Mathematical problem-solving
- Grammar analysis in Pashto context
- Real-world Afghan market scenarios
3. ⚡ Production-Ready Quality
- Zero duplicates guaranteed
- Resume capability for interrupted training
- Multi-framework support (LLaMA-Factory, Axolotl, Transformers)
🗂️ Data Structure
Each record follows a clean, standardized conversational schema compatible with modern training frameworks:
{
"conversations": [
{
"from": "system",
"value": "تاسو Qwen یاست، د علی بابا کلاوډ لخوا جوړ شوی. تاسو یو ګټور معاون یاست."
},
{
"from": "human",
"value": "زما سره مرسته وکړئ چې په ګوته کړم چې آیا لاندې جملې یو واحد مضمون لري یا جمع مضمونونه..."
},
{
"from": "gpt",
"value": "دلته په هره جمله کې د موضوع واحد / جمع حالت دی: 1. واحد موضوع..."
}
]
}🧹 Curation & Quality Engineering
🔐 Atomic Deduplication
Built using customized MD5 cryptographic hashing pipelines to guarantee absolute uniqueness across all training instances.
🧩 Smart Chunking
Text blocks are contextually managed under safe token lengths (max_chars=4000) to maintain paragraph cohesion and native Pashto grammar alignment.
🔄 Resume-Ready Pipeline
If processing stops, just run the script again - it automatically resumes from where it left off!
🎨 Cognitive Diversity
Includes:
- Structural parsing of Pashto grammar
- Linguistic identification exercises
- Visual-spatial grouping simulations
- Local market mathematical reasoning (Afghan currency, pricing, etc.)
📈 Dataset Breakdown by Category
🚀 Training Recommendations
Supported Frameworks
Recommended Hyperparameters
learning_rate: 2e-5
batch_size: 4
gradient_accumulation: 8
warmup_ratio: 0.03
lr_scheduler_type: cosine
max_seq_length: 2048
epochs: 3
optimizer: adamw_torch💻 Usage Examples
Python (Hugging Face)
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("nassimjp/qwopus-pashto-reasoning-sft", split="train")
print(f"Dataset size: {len(dataset)} conversations")
# Access a conversation
conversation = dataset[0]
for message in conversation["conversations"]:
print(f"{message['from']}: {message['value'][:100]}...")Text Generation with Transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2-7B")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2-7B")
# Fine-tune using the dataset
# Then generate Pashto text
inputs = tokenizer("د پښتو جملې موضوع څه ده؟", return_tensors="pt")
outputs = model.generate(**inputs, max_length=200)
print(tokenizer.decode(outputs[0]))LLaMA-Factory Training
# Single GPU training
llamafactory-cli train \
--model_name_or_path Qwen/Qwen2-7B \
--dataset qwopus-pashto-reasoning-sft \
--template qwen \
--output_dir ./output \
--per_device_train_batch_size 4Axolotl Configuration
# config.yml
base_model: Qwen/Qwen2-7B
model_type: AutoModelForCausalLM
tokenizer_type: AutoTokenizer
datasets:
- path: nassimjp/qwopus-pashto-reasoning-sft
type: sharegpt
conversation: qwen
sequence_len: 2048
micro_batch_size: 4
gradient_accumulation_steps: 8
learning_rate: 2e-5
num_epochs: 3📝 Sample Training Output
After fine-tuning on this dataset, models demonstrate:
✅ Native-level Pashto reasoning ✅ Step-by-step explanation capability ✅ Grammar analysis in Pashto ✅ Mathematical problem-solving in Pashto context
📊 Benchmarks
Evaluated on held-out reasoning tasks
🌍 Community & Impact
This dataset is part of the growing Pashto AI Ecosystem:
🤝 Contribute & Support
Want to help grow Pashto AI?
- ⭐ Star this repository
- 🐛 Report issues
- 🔧 Submit PRs for improvements
- 📢 Share with your network
- 💰 Sponsor via GitHub Sponsors
🚀 Citation & Usage
If you utilize this dataset in your research or LLM training cycles, please credit the repository as follows:
@misc{qwopus-pashto-reasoning-sft,
author = {Nassim (nassimjp)},
title = {Qwopus Pashto Reasoning SFT Dataset},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Datasets},
howpublished = {\url{https://huggingface.co/datasets/nassimjp/qwopus-pashto-reasoning-sft}}
}🗺️ Provenance & Adaptation
This dataset is a translated, optimized, and adapted version of kalomaze/Opus_Instruct_3k.
Transformations Applied:
- ✅ Complete Pashto translation with atomic chunking
- ✅ Cryptographic MD5 deduplication
- ✅ Structural standardization to Qwen format
- ✅ Quality filtering (removed 15% low-quality examples)
- ✅ Cultural localization for Pashto-speaking regions
- ✅ Resume-ready pipeline implementation
📄 License
This dataset is released under the Apache License 2.0, permitting commercial and research use with appropriate attribution.
🙏 Acknowledgments
- Original dataset:
kalomaze/Opus_Instruct_3k - Google Translate API for translation services
- Hugging Face for dataset hosting
- Pashto NLP community for feedback and support
🔗 Quick Links
   
🌟 که دا ډیټاسیټ ستاسو لپاره ګټور و، نو ستوری (Star) ورکول مه هیروئ! If you find this dataset useful, don't forget to give it a star!
🇦🇫 د پښتو AI راتلونکی جوړوو! Building the future of Pashto AI together!
