datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
tibetan-speech-english-text-dataset
Tibetan Speech Dataset with English Translations
Dataset Description
This dataset contains Tibetan speech recordings paired with transcriptions in Tibetan script and English translations. It is designed to support automatic speech recognition (ASR), machine translation, and text-to-speech (TTS) research for the Tibetan language, which is considered a low-resource language in NLP.
Supported Tasks
Automatic Speech Recognition (ASR): Train models to transcribe… See the full description on the dataset page: https://huggingface.co/datasets/lilgoose777/tibetan-speech-english-text-dataset.tibetan-to-english-audio-dataset
Tibetan to English Audio Dataset
Dataset Description
A Tibetan speech recognition dataset with transcriptions and English translations containing 1,642 audio samples.
Dataset Summary
This dataset contains Tibetan speech recordings with:
Tibetan transcriptions in native script
English translations
High-quality audio files in WAV format
Total Samples: 1,178Total Size: ~1.1 GBAudio Format: WAV
Languages
Source Language: Tibetan (བོད་སྐད་)
Target… See the full description on the dataset page: https://huggingface.co/datasets/Titung/tibetan-to-english-audio-dataset.tibetan-audio-to-english-fixed-filtered
Tibetan audio translation Dataset
Dataset Description
Tibetan audio translation Dataset
Dataset Summary
This dataset contains 6,366 audio samples with corresponding transcriptions, totaling approximately 15.8 hours of audio.
Languages
The dataset is in EN (Language code: en).
Dataset Structure
Data Fields
audio: An audio object containing:
path: Path to the audio file (if applicable)
array: Audio waveform as a numpy array… See the full description on the dataset page: https://huggingface.co/datasets/Titung/tibetan-audio-to-english-fixed-filtered.tibetan-audio-english-6datasets-sample2
Tibetan Audio-English Sentence Dataset (Sample)
This is a sample dataset containing 5 rows from a merged collection of 6 Tibetan audio datasets with English translations.
📊 Dataset Details
Total Samples in Full Dataset: 17,278
Samples in This Preview: 5
Format: Audio + English sentence pairs
Audio Sampling Rate: 16,000 Hz
Languages: Tibetan (audio) → English (text)
🗂️ Source Datasets
This sample is merged from 6 datasets:… See the full description on the dataset page: https://huggingface.co/datasets/lilgoose777/tibetan-audio-english-6datasets-sample2.tibetan-audio-english-6datasets-sample
Tibetan Audio-English Sentence Dataset (Sample)
This is a sample dataset containing 5 rows from a merged collection of 6 Tibetan audio datasets with English translations.
📊 Dataset Details
Total Samples in Full Dataset: 17,278
Samples in This Preview: 5
Format: Audio + English sentence pairs
Audio Sampling Rate: 16,000 Hz
Languages: Tibetan (audio) → English (text)
🗂️ Source Datasets
This sample is merged from 6 datasets:… See the full description on the dataset page: https://huggingface.co/datasets/lilgoose777/tibetan-audio-english-6datasets-sample.
