NabajyotiPathak/kiswahili-ai-blended
Kiswahili AI — Swahili Instruction Model AutoScientist Challenge 2026 — Language Category Overview Kiswahili AI is a Swahili instruction-tuned language model fine-tuned from Llama-4-Scout-17B-16E-Instruct (109B MoE) using AutoScientist by Adaption Labs. It combines 4 public Swahili datasets into a unified instruction dataset (~52K rows), processes them through Adaptive Data for quality enhancement, and trains via AutoScientist's closed-loop co-optimization.… See the full description on the dataset page: https://huggingface.co/datasets/NabajyotiPathak/kiswahili-ai-blended.
Kiswahili AI — Swahili Instruction Model
AutoScientist Challenge 2026 — Language Category
Overview
Kiswahili AI is a Swahili instruction-tuned language model fine-tuned from Llama-4-Scout-17B-16E-Instruct (109B MoE) using AutoScientist by Adaption Labs. It combines 4 public Swahili datasets into a unified instruction dataset (~52K rows), processes them through Adaptive Data for quality enhancement, and trains via AutoScientist's closed-loop co-optimization.
Result: 73% win rate (adapted) vs 27% (baseline) — +170% relative improvement on Adaption's held-out test set.
Why Swahili? Over 100 million speakers across East Africa. Swahili is a low-resource language where current LLMs show a 28-45% performance gap compared to English.
Dataset
Data Adaptation
The raw dataset scored Grade D (6.9th percentile). After Adaptive Data processing (deduplication + reasoning traces + hallucination mitigation), quality improved +62% to Grade B (25.6th percentile).
Training
Results
Pipeline
Public HF Datasets → Blend Script → JSONL → Adaptive Data →
Adaptation (D→B) → AutoScientist → Trained Model → HF + Kaggle- Blend:
data/blend_swahili.pydownloads and merges 4 datasets - Validate:
data/validate_format.pychecks JSONL quality - Adapt: Adaptive Data — deduplication, reasoning traces, hallucination mitigation
- Train: AutoScientist co-optimizes data + training recipe
- Release: Weights + dataset on Hugging Face + Kaggle
How to Use
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("NabajyotiPathak/kiswahili-ai")
tokenizer = AutoTokenizer.from_pretrained("NabajyotiPathak/kiswahili-ai")
prompt = "Elezea umuhimu wa teknolojia katika elimu."
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(**inputs, max_length=512)
print(tokenizer.decode(outputs[0]))Project Structure
swahili-ai/
├── data/
│ ├── blend_swahili.py # Download + blend 4 datasets
│ ├── validate_format.py # Validate output format
│ ├── sources.json # Dataset provenance
│ └── swahili_blended/ # Output directory (generated)
├── docs/
│ ├── MODEL_CARD.md # Hugging Face model card
│ └── DATASET_CARD.md # Hugging Face dataset card
├── adaptive_data_config.md # Adaptive Data settings
├── autoscientist_config.md # AutoScientist experiment config
└── README.mdReproducibility
- Run
data/blend_swahili.pyto recreate the blended dataset from public sources - Upload to Adaptive Data with: deduplication + reasoning traces + hallucination mitigation
- Train via AutoScientist with LoRA on Llama-4-Scout-17B
Links
- Model: https://huggingface.co/NabajyotiPathak/kiswahali-ai
- Dataset: https://huggingface.co/datasets/NabajyotiPathak/kiswahili-ai-blended
- Kaggle Dataset: https://www.kaggle.com/datasets/nabajyotipathak/kiswahili-ai-blended
- Kaggle Model: https://www.kaggle.com/models/nabajyotipathak/kiswahili-ai-blended
- GitHub: https://github.com/ThatDawg/kiswahili-ai
Judging Criteria Alignment
License
Apache 2.0
Acknowledgments
- Adaption Labs — AutoScientist + Adaptive Data + free compute
- Samwel Ngusa — FineTome-20k-sw
- Kencorpus Project — KenSwQuAD
- Mich Seth Owusu — Code-170k-swahili
- Noel Masasi & Bernard Masua — Swahili-Corpus-Dataset
