narendarcodes/Telugu-MultiTask-Instruct-77K
Telugu MultiTask Instruct 77K — Adaption AutoScientist Challenge Dataset Powered by Adaptive Data — Adaption Labs Dataset Description A large-scale, multi-task Telugu instruction-tuning dataset combining 77,653 rows from 7 open-source Telugu NLP collections. Covers diverse tasks including news summarization, QA, creative writing, translation, and general instruction following — all processed through the Adaption Labs AutoScientist platform for quality… See the full description on the dataset page: https://huggingface.co/datasets/narendarcodes/Telugu-MultiTask-Instruct-77K.
Telugu MultiTask Instruct 77K — Adaption AutoScientist Challenge Dataset
Powered by Adaptive Data — [Adaption Labs](https://www.adaptionlabs.ai/)
Dataset Description
A large-scale, multi-task Telugu instruction-tuning dataset combining 77,653 rows from 7 open-source Telugu NLP collections. Covers diverse tasks including news summarization, QA, creative writing, translation, and general instruction following — all processed through the Adaption Labs AutoScientist platform for quality enhancement.
This dataset was created for the 2026 Adaption AutoScientist Challenge (Language Category).
Dataset Details
Source Data & Attribution
Quality Enhancement via Adaption Labs
The dataset was processed through the Adaption Labs Adaptive Data Pipeline:
AutoScientist features applied:
- ✅ Prompt Deduplication
- ✅ Prompt Rephrase
- ✅ Hallucination Mitigation
- ✅ Reasoning Traces
Associated Model
- HuggingFace: narendarcodes/adaption-gpt-oss-120b-telugu-instruct
- Base Model:
togethercomputer/gpt-oss-120b-bf16(117B) - Win Rate: 66% adapted vs. 34% base
Citation
@misc{golla2026telugu_data,
title={Telugu MultiTask Instruct 77K Dataset},
author={Golla Narendar},
year={2026},
note={Processed via Adaption Labs AutoScientist. Powered by Adaptive Data.}
}Powered by Adaptive Data — [Adaption Labs](https://www.adaptionlabs.ai/)
