CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01humairmunirawn /xp3x-kashmiritext1M<n<10M0 likes212 downloads5mo agoHugging Face02nawabhussain /Kashmiri-Language-Corpus Kashmiri Textual Data Corpus Introduction This repository contains a combined dataset of Kashmiri textual data collected from various sources. The data has been sourced from different locations and may contain non-Kashmiri text (e.g., Urdu, Persian). The goal of this corpus is to provide a wide variety of Kashmiri text data for research and language processing tasks. Sources of Data 1. mzmmoazam/kashmiri_dataset (HTML Data) Source: GitHub -… See the full description on the dataset page: https://huggingface.co/datasets/nawabhussain/Kashmiri-Language-Corpus.text10K<n<100K2 likes183 downloads2y agoHugging Face03humairmunirawn /aya-kashmiri-onlytext1M<n<10M0 likes166 downloads5mo agoHugging Face04Aadilgani /kashmiri-text-datasettext10K<n<100K0 likes148 downloads1y agoHugging Face05Omarrran /kashmiri_English_parallel_corpus_49Kgated license: apache-2.0 task_categories: translation language: ks Usage Terms for this Dataset Purpose of UseThis dataset is made available for the purpose of training machine learning models, academic research, and other non-commercial uses and its applications. Citation RequirementIf you use this dataset for research, training models, or any other purpose, you must provide proper attribution by citing the following: @misc {haq_nawaz_malik_2024, author = { {HAQ NAWAZ… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_English_parallel_corpus_49K.text10K<n<100K2 likes82 downloads1y agoHugging Face06Omarrran /Sample_kashmiri_sft_dataset Dataset Details: This dataset is a sample of a Kashmiri SFT Q&A-based dataset. Currently, scaling it requires GPU compute. If you have the necessary compute resources, we can collaborate to scale this dataset further. please connect me at "hnm.cs.ai@outlook.com" textn<1K0 likes73 downloads6mo agoHugging Face07programindz /kashmiri-audio-corpus Kashmiri Audio Segmented Corpus (Derived from OpenSLR-122) Metadata Size: 1955 speech segments Audio: 16 kHz, 16-bit, mono, WAV License: GPL-3.0 Language: Kashmiri (کٲشُر) Description This dataset contains short Kashmiri speech fragments that were automatically sliced from the original OpenSLR-122 recordingsThis dataset can be used for ASREach row provides: audio – the waveform text – the verbatim Kashmiri transcript duration – segment… See the full description on the dataset page: https://huggingface.co/datasets/programindz/kashmiri-audio-corpus.audio1K<n<10K1 likes61 downloads10mo agoHugging Face08Maitreyajayaraj /kashmiri_clean_batch_4.1textn<1K0 likes43 downloads5mo agoHugging Face09Omarrran /kashmiri_tts_hf_dataset Omarrran/kashmiri_tts_hf_dataset Dataset Description This dataset contains Kashmiri text-to-speech (TTS) data, including paired text and audio files. Dataset Statistics Total number of samples: 33 Number of samples in train split: 26 Number of samples in test split: 7 Audio Statistics Total audio duration: 9766.49 seconds (2.71 hours) Average audio duration: 295.95 seconds Minimum audio duration: 84.60 seconds Maximum audio duration: 606.91… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_tts_hf_dataset.audion<1K0 likes38 downloads2y agoHugging Face10programindz /kashmiri-tts-single-speaker Kashmiri Single Speaker TTS Corpus Overview This repository provides a single-speaker Kashmiri Text-to-Speech (TTS) corpus in Perso-Arabic script. The dataset consists of paired speech recordings and text transcriptions intended for training and evaluating neural text-to-speech systems. All recordings were produced by a single male native Kashmiri speaker. Dataset Statistics Property Value Number of utterances 2984 Total duration 4.42… See the full description on the dataset page: https://huggingface.co/datasets/programindz/kashmiri-tts-single-speaker.audiotext-to-speech1K<n<10K1 likes36 downloads2mo agoHugging Face11muneebharoon /whisper-kashmiriaudion<1K0 likes18 downloads1y agoHugging Face12Maitreyajayaraj /kashmiri_clinical_reasoning_batch_4textn<1K0 likes15 downloads5mo agoHugging Face13Omarrran /Kashmiri__Text_Corpus_Datasetgated Comprehensive Kashmiri Text Analysis Report 1. File Information Filename:FULL CORPUS KASHMIRI TEXT.txt Size: 15 Mb (15066.21 KB) (15,427,794 bytes) Created: 2024-10-29 19:35:41 Modified: 2024-10-29 19:35:41 encoding: utf-8 language_hint: kashmiri 2. Text Statistics Total Characters: 8,560,982 Total Words: 1,691,085 (1.6 million) Total Lines: 22,882 (one line collection of many sentences) Unique Words: 57,073 Vocabulary Density: 3.37% Words per Line:… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/Kashmiri__Text_Corpus_Dataset.texttext-generation10K<n<100K3 likes14 downloads2y agoHugging Face14injilashah /kashmiri_text_and_audiotextn<1K0 likes13 downloads2y agoHugging Face15Omarrran /3.1Million_KASHMIRI_text_Pre_training_Dataset_for_LLM_2026_by_HNMgated DATASET NAME: KS-LIT-3M Kashmiri Pretraining Dataset This repository hosts a meticulously processed Kashmiri text dataset, specifically designed for pretraining Large Language Models (LLMs) from scratch. The dataset has undergone extensive cleaning and preprocessing to ensure high quality and suitability for robust model training. Dataset Description This dataset consists of a continuous one stream of Kashmiri text, cleaned to remove English… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/3.1Million_KASHMIRI_text_Pre_training_Dataset_for_LLM_2026_by_HNM.texttext-generationn<1K4 likes13 downloads5mo agoHugging Face16Maitreyajayaraj /kashmiri_medical_math_reasoning_v10textn<1K0 likes13 downloads5mo agoHugging Face17Maitreyajayaraj /kashmiri_medical_math_reasoning_v8textn<1K0 likes12 downloads5mo agoHugging Face18humair025 /KashmiriSpeech-IndicVoicesaudio100K<n<1M0 likes11 downloads10mo agoHugging Face19Maitreyajayaraj /kashmiri_clinical_reasoning_batch_2textn<1K0 likes11 downloads5mo agoHugging Face20Maitreyajayaraj /kashmiri_medical_math_reasoning_v5.1textn<1K0 likes11 downloads5mo agoHugging Face21Maitreyajayaraj /kashmiri_medical_math_reasoning_v7textn<1K0 likes11 downloads5mo agoHugging Face22Omarrran /english-kashmiri-1m-translationsgated English-Kashmiri 1M Translations This dataset contains English → Kashmiri machine translation outputs generated in 10 splits. Dataset Viewer The Hugging Face Dataset Viewer is configured to read the Parquet file under: data/train-00000-of-00001.parquet This avoids the viewer trying to parse the XLSX artifacts directly. Files Requested release files: splits/ — all 10 translated XLSX split files. full/english_kashmiri_1m_merged.xlsx — one merged… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/english-kashmiri-1m-translations.tabulartranslation100K<n<1M0 likes11 downloads2mo agoHugging Face23Omarrran /KS-PRET-5M_5_million_kashmiri_Pretrainning_LLM_dataset_12M_tokens_2026gated KS-PRET-5M: Kashmiri Pretraining Corpus 5,090,244 words · ~12,130,000 subword tokens · 295,433 vocabulary · April 2026 Building the complete AI stack for Kashmiri — 7 million speakers, virtually no prior computational resources. Dataset Summary KS-PRET-5M is a large-scale, deeply cleaned Kashmiri language pretraining corpus — the largest publicly available dataset for the Kashmiri language. All text is formatted as a single continuous stream, the standard… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/KS-PRET-5M_5_million_kashmiri_Pretrainning_LLM_dataset_12M_tokens_2026.texttext-generationn<1K1 likes10 downloads5mo agoHugging Face24Maitreyajayaraj /kashmiri_clinical_reasoning_batch_1textn<1K0 likes10 downloads5mo agoHugging Face25muneebharoon /whisper-kashmiri-2audion<1K0 likes9 downloads2y agoHugging Face26Maitreyajayaraj /kashmiri_medical_math_reasoning_v9textn<1K0 likes9 downloads5mo agoHugging Face27Maitreyajayaraj /kashmiri_clinical_reasoning_batch_3textn<1K0 likes8 downloads5mo agoHugging Face28XKaab /ASR-Kashmiri_4hrsaudio1K<n<10K0 likes8 downloads3mo agoHugging Face29Omarrran /Kashmiri_Text_Corpus_Cleaned_2025_HNMgated Overview A comprehensive linear text corpus of the Kashmiri language, optimized for large language model (LLM) pre-training. Corpus Text Analysis Report The corpus contains approximately 2 million words, with over 91,000 unique words The entire corpus is formatted as a single continuous line of text, ideal for LLM Pre-training The cleaning process removed about 4.4% of characters while preserving 99.3% of words Vocabulary richness… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/Kashmiri_Text_Corpus_Cleaned_2025_HNM.texttext-generationn<1K0 likes7 downloads9mo agoHugging Face30Omarrran /kashmiri_parallel_Diacratic_to_Non_diacratic_Text_datasetgated THE DATASET CAN BE USED AS: 1. 🎯 Diacritics Restoration Models Train sequence-to-sequence models to automatically add diacritics to plain Kashmiri text. Input: کاشر زبان (plain text)Output: کٲشُر زَبان (with diacritics) Model architectures: Transformer-based (BERT, T5, mT5) LSTM/GRU sequence-to-sequence Character-level neural networks Training approach: # Example: Fine-tuning mT5 for diacritization from transformers import MT5ForConditionalGeneration model =… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset.texttext-classification10K<n<100K0 likes7 downloads3mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.