CoolFace
9 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01mangi-llm /Kazakh_Multi-Task_corpus Kazakh Multi-task Corpus A multi-task NLP dataset in the Kazakh language, covering seven distinct language tasks - from instruction-following and question answering to translation, sentiment analysis, and grammar exercises. Designed to support the development of Kazakh-language models, benchmarks, and linguistic research. Dataset Summary Kazakh is a Turkic language spoken by over 13 million people, yet it remains significantly underrepresented in NLP research and… See the full description on the dataset page: https://huggingface.co/datasets/mangi-llm/Kazakh_Multi-Task_corpus.text-generation1K<n<10K1 likes73 downloads7mo agoHugging Face02narendarcodes /Telugu-MultiTask-Instruct-77K Telugu MultiTask Instruct 77K — Adaption AutoScientist Challenge Dataset Powered by Adaptive Data — Adaption Labs Dataset Description A large-scale, multi-task Telugu instruction-tuning dataset combining 77,653 rows from 7 open-source Telugu NLP collections. Covers diverse tasks including news summarization, QA, creative writing, translation, and general instruction following — all processed through the Adaption Labs AutoScientist platform for quality… See the full description on the dataset page: https://huggingface.co/datasets/narendarcodes/Telugu-MultiTask-Instruct-77K.textquestion-answering10K<n<100K1 likes44 downloads3mo agoHugging Face03Maid121232 /majid-multitask-dataset Majid Multi-task Dataset | مجموعه داده چندوظیفه‌ای مجید English Description 🇬🇧 This dataset provides Persian–English text for multi-task NLP: text classification and question answering, including subtasks such as sentiment analysis and toxicity detection. Dataset Details Curated by: Maid121232 (Majid) Languages: Persian (fa), English (en) License: Apache-2.0 Size: Small (< 10k samples) Tasks: Text Classification, Question Answering Dataset Structure Files: train.csv… See the full description on the dataset page: https://huggingface.co/datasets/Maid121232/majid-multitask-dataset.texttext-classificationn<1K0 likes40 downloads1y agoHugging Face04TheTokenFactory /sec-extraction-multitask-v4 SEC Extraction Multitask v4 Instruction-tuning dataset for fine-tuning a small language model (e.g. Gemma 4 E2B) to extract structured data from SEC filings across three verticals: Exhibit 10 (contracts) — financial terms from executive employment, credit agreements, indemnification, licensing, and similar filings DEF 14A (proxy statements) — executive compensation, governance items, say-on-pay MD&A (10-K / 10-Q Management's Discussion & Analysis) — operating metrics, segment… See the full description on the dataset page: https://huggingface.co/datasets/TheTokenFactory/sec-extraction-multitask-v4.texttext-generation1K<n<10K0 likes40 downloads5mo agoHugging Face05toolevalxm /MultiTaskNLP-TestDataset MultiTaskNLP-Dataset 1. Introduction The MultiTaskNLP-Dataset has undergone significant quality improvements through iterative data curation. In the latest version, we have substantially enhanced the data completeness and label accuracy by implementing rigorous annotation protocols and multi-stage quality assurance mechanisms. The dataset demonstrates outstanding quality metrics across various dimensions, including completeness, accuracy… See the full description on the dataset page: https://huggingface.co/datasets/toolevalxm/MultiTaskNLP-TestDataset.imagetext-classificationn<1K0 likes34 downloads7mo agoHugging Face06Phettae /thai-multitask-starter Thai Multitask 9.6K ชุดข้อมูลตั้งต้นสำหรับ instruction tuning ภาษาไทย ครอบคลุมงานสนทนา ถาม–ตอบ สรุป แปล จำแนกข้อความ ตรวจแก้ภาษา คณิตศาสตร์ และ structured output ข้อมูลทุกแถวสร้างขึ้นใหม่ด้วยกฎแบบ deterministic ไม่มีการคัดลอกจากเว็บไซต์หรือ ข้อมูลส่วนบุคคลจริง เหมาะสำหรับทดลอง supervised fine-tuning และทดสอบ pipeline แต่ควรเพิ่มข้อมูลที่มนุษย์ตรวจทานและข้อมูลภาษาธรรมชาติก่อนใช้กับระบบจริง จำนวนข้อมูลทั้งหมด 9,599 ตัวอย่าง: train 8,639, validation 480 และ test 480… See the full description on the dataset page: https://huggingface.co/datasets/Phettae/thai-multitask-starter.texttext-generation1K<n<10K0 likes34 downloads1mo agoHugging Face07AethronPhantom /nexa-science-multitask-balanced Nexa Science Multitask Balanced This dataset is a curated, instruction-formatted scientific multitask mixture for: claim verification (<TASK:VERIFY>) abstract-grounded biomedical QA (<TASK:QA>) retrieval relevance re-ranking (<TASK:RERANK>) Format Each row is JSONL with: {task, instruction, input, output, meta} Splits Included train_balanced_short.jsonl val_balanced_short.jsonl stats_balanced_short.json Notes QA in this balanced release is… See the full description on the dataset page: https://huggingface.co/datasets/AethronPhantom/nexa-science-multitask-balanced.texttext-classification10K<n<100K0 likes31 downloads7mo agoHugging Face08Miladsaeedi70 /scientific-multitask-instructions Scientific Multitask Instructions A multi-task scientific instruction-following dataset created for supervised fine-tuning and preference-optimization experiments. Dataset summary The dataset contains 1,576 conversational scientific examples across eight task types. Split Examples Train 1,260 Validation 158 Test 158 Total 1,576 Task distribution Task Examples Scientific question answering 256 Summarization 220… See the full description on the dataset page: https://huggingface.co/datasets/Miladsaeedi70/scientific-multitask-instructions.texttext-generation1K<n<10K0 likes26 downloads2mo agoHugging Face09fr3on /eg-legal-multi-task Arabic Legal Dataset - Multi-Task Legal Learning Dataset Description Multi-task learning dataset combining classification, QA, NER, and summarization tasks in unified format. This dataset contains 1,046 examples of multi_task data derived from Egyptian legal texts, including criminal law, civil law, procedural law, and personal status law. The dataset is designed for training and evaluating Arabic legal AI models. Dataset Summary Language: Arabic (Egyptian… See the full description on the dataset page: https://huggingface.co/datasets/fr3on/eg-legal-multi-task.texttext-classification1K<n<10K0 likes24 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.