datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
xp3x-kashmiriKashmiri-Language-Corpus
Kashmiri Textual Data Corpus
Introduction
This repository contains a combined dataset of Kashmiri textual data collected from various sources. The data has been sourced from different locations and may contain non-Kashmiri text (e.g., Urdu, Persian). The goal of this corpus is to provide a wide variety of Kashmiri text data for research and language processing tasks.
Sources of Data
1. mzmmoazam/kashmiri_dataset (HTML Data)
Source: GitHub -… See the full description on the dataset page: https://huggingface.co/datasets/nawabhussain/Kashmiri-Language-Corpus.aya-kashmiri-onlykashmiri-text-datasetkashmiri_English_parallel_corpus_49K
license: apache-2.0
task_categories:
translation
language:
ks
Usage Terms for this Dataset
Purpose of UseThis dataset is made available for the purpose of training machine learning models, academic research, and other non-commercial uses and its applications.
Citation RequirementIf you use this dataset for research, training models, or any other purpose, you must provide proper attribution by citing the following:
@misc {haq_nawaz_malik_2024,
author = { {HAQ NAWAZ… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_English_parallel_corpus_49K.Sample_kashmiri_sft_dataset
Dataset Details:
This dataset is a sample of a Kashmiri SFT Q&A-based dataset. Currently, scaling it requires GPU compute. If you have the necessary compute resources, we can collaborate to scale this dataset further.
please connect me at "hnm.cs.ai@outlook.com"
kashmiri-audio-corpus
Kashmiri Audio Segmented Corpus
(Derived from OpenSLR-122)
Metadata
Size: 1955 speech segments
Audio: 16 kHz, 16-bit, mono, WAV License: GPL-3.0
Language: Kashmiri (کٲشُر)
Description
This dataset contains short Kashmiri speech fragments that were automatically sliced from the original OpenSLR-122 recordingsThis dataset can be used for ASREach row provides:
audio – the waveform
text – the verbatim Kashmiri transcript
duration – segment… See the full description on the dataset page: https://huggingface.co/datasets/programindz/kashmiri-audio-corpus.kashmiri_clean_batch_4.1kashmiri_tts_hf_dataset
Omarrran/kashmiri_tts_hf_dataset
Dataset Description
This dataset contains Kashmiri text-to-speech (TTS) data, including paired text and audio files.
Dataset Statistics
Total number of samples: 33
Number of samples in train split: 26
Number of samples in test split: 7
Audio Statistics
Total audio duration: 9766.49 seconds (2.71 hours)
Average audio duration: 295.95 seconds
Minimum audio duration: 84.60 seconds
Maximum audio duration: 606.91… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_tts_hf_dataset.kashmiri-tts-single-speaker
Kashmiri Single Speaker TTS Corpus
Overview
This repository provides a single-speaker Kashmiri Text-to-Speech (TTS) corpus in Perso-Arabic script.
The dataset consists of paired speech recordings and text transcriptions intended for training and evaluating neural text-to-speech systems.
All recordings were produced by a single male native Kashmiri speaker.
Dataset Statistics
Property
Value
Number of utterances
2984
Total duration
4.42… See the full description on the dataset page: https://huggingface.co/datasets/programindz/kashmiri-tts-single-speaker.whisper-kashmirikashmiri_clinical_reasoning_batch_4Kashmiri__Text_Corpus_Dataset
Comprehensive Kashmiri Text Analysis Report
1. File Information
Filename:FULL CORPUS KASHMIRI TEXT.txt
Size: 15 Mb (15066.21 KB) (15,427,794 bytes)
Created: 2024-10-29 19:35:41
Modified: 2024-10-29 19:35:41
encoding: utf-8
language_hint: kashmiri
2. Text Statistics
Total Characters: 8,560,982
Total Words: 1,691,085 (1.6 million)
Total Lines: 22,882 (one line collection of many sentences)
Unique Words: 57,073
Vocabulary Density: 3.37%
Words per Line:… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/Kashmiri__Text_Corpus_Dataset.kashmiri_text_and_audio3.1Million_KASHMIRI_text_Pre_training_Dataset_for_LLM_2026_by_HNM
DATASET NAME: KS-LIT-3M
Kashmiri Pretraining Dataset
This repository hosts a meticulously processed Kashmiri text dataset, specifically designed for pretraining Large Language Models (LLMs) from scratch. The dataset has undergone extensive cleaning and preprocessing to ensure high quality and suitability for robust model training.
Dataset Description
This dataset consists of a continuous one stream of Kashmiri text, cleaned to remove English… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/3.1Million_KASHMIRI_text_Pre_training_Dataset_for_LLM_2026_by_HNM.kashmiri_medical_math_reasoning_v10kashmiri_medical_math_reasoning_v8KashmiriSpeech-IndicVoiceskashmiri_clinical_reasoning_batch_2kashmiri_medical_math_reasoning_v5.1kashmiri_medical_math_reasoning_v7english-kashmiri-1m-translations
English-Kashmiri 1M Translations
This dataset contains English → Kashmiri machine translation outputs generated in 10 splits.
Dataset Viewer
The Hugging Face Dataset Viewer is configured to read the Parquet file under:
data/train-00000-of-00001.parquet
This avoids the viewer trying to parse the XLSX artifacts directly.
Files
Requested release files:
splits/ — all 10 translated XLSX split files.
full/english_kashmiri_1m_merged.xlsx — one merged… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/english-kashmiri-1m-translations.KS-PRET-5M_5_million_kashmiri_Pretrainning_LLM_dataset_12M_tokens_2026
KS-PRET-5M: Kashmiri Pretraining Corpus
5,090,244 words · ~12,130,000 subword tokens · 295,433 vocabulary · April 2026
Building the complete AI stack for Kashmiri — 7 million speakers, virtually no prior computational resources.
Dataset Summary
KS-PRET-5M is a large-scale, deeply cleaned Kashmiri language pretraining corpus — the largest publicly available dataset for the Kashmiri language. All text is formatted as a single continuous stream, the standard… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/KS-PRET-5M_5_million_kashmiri_Pretrainning_LLM_dataset_12M_tokens_2026.kashmiri_clinical_reasoning_batch_1whisper-kashmiri-2kashmiri_medical_math_reasoning_v9kashmiri_clinical_reasoning_batch_3ASR-Kashmiri_4hrsKashmiri_Text_Corpus_Cleaned_2025_HNM
Overview
A comprehensive linear text corpus of the Kashmiri language, optimized for large language model (LLM) pre-training.
Corpus Text Analysis Report
The corpus contains approximately 2 million words, with over 91,000 unique words
The entire corpus is formatted as a single continuous line of text, ideal for LLM Pre-training
The cleaning process removed about 4.4% of characters while preserving 99.3% of words
Vocabulary richness… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/Kashmiri_Text_Corpus_Cleaned_2025_HNM.kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset
THE DATASET CAN BE USED AS:
1. 🎯 Diacritics Restoration Models
Train sequence-to-sequence models to automatically add diacritics to plain Kashmiri text.
Input: کاشر زبان (plain text)Output: کٲشُر زَبان (with diacritics)
Model architectures:
Transformer-based (BERT, T5, mT5)
LSTM/GRU sequence-to-sequence
Character-level neural networks
Training approach:
# Example: Fine-tuning mT5 for diacritization
from transformers import MT5ForConditionalGeneration
model =… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset.
