CoolFace
5 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01lilgoose777 /tibetan-speech-english-text-dataset Tibetan Speech Dataset with English Translations Dataset Description This dataset contains Tibetan speech recordings paired with transcriptions in Tibetan script and English translations. It is designed to support automatic speech recognition (ASR), machine translation, and text-to-speech (TTS) research for the Tibetan language, which is considered a low-resource language in NLP. Supported Tasks Automatic Speech Recognition (ASR): Train models to transcribe… See the full description on the dataset page: https://huggingface.co/datasets/lilgoose777/tibetan-speech-english-text-dataset.audioautomatic-speech-recognition1K<n<10K0 likes50 downloads8mo agoHugging Face02Titung /tibetan-to-english-audio-dataset Tibetan to English Audio Dataset Dataset Description A Tibetan speech recognition dataset with transcriptions and English translations containing 1,642 audio samples. Dataset Summary This dataset contains Tibetan speech recordings with: Tibetan transcriptions in native script English translations High-quality audio files in WAV format Total Samples: 1,178Total Size: ~1.1 GBAudio Format: WAV Languages Source Language: Tibetan (བོད་སྐད་) Target… See the full description on the dataset page: https://huggingface.co/datasets/Titung/tibetan-to-english-audio-dataset.audioautomatic-speech-recognition1K<n<10K0 likes33 downloads8mo agoHugging Face03Titung /tibetan-audio-to-english-fixed-filtered Tibetan audio translation Dataset Dataset Description Tibetan audio translation Dataset Dataset Summary This dataset contains 6,366 audio samples with corresponding transcriptions, totaling approximately 15.8 hours of audio. Languages The dataset is in EN (Language code: en). Dataset Structure Data Fields audio: An audio object containing: path: Path to the audio file (if applicable) array: Audio waveform as a numpy array… See the full description on the dataset page: https://huggingface.co/datasets/Titung/tibetan-audio-to-english-fixed-filtered.audioautomatic-speech-recognition1K<n<10K0 likes28 downloads8mo agoHugging Face04lilgoose777 /tibetan-audio-english-6datasets-sample2 Tibetan Audio-English Sentence Dataset (Sample) This is a sample dataset containing 5 rows from a merged collection of 6 Tibetan audio datasets with English translations. 📊 Dataset Details Total Samples in Full Dataset: 17,278 Samples in This Preview: 5 Format: Audio + English sentence pairs Audio Sampling Rate: 16,000 Hz Languages: Tibetan (audio) → English (text) 🗂️ Source Datasets This sample is merged from 6 datasets:… See the full description on the dataset page: https://huggingface.co/datasets/lilgoose777/tibetan-audio-english-6datasets-sample2.audioautomatic-speech-recognitionn<1K0 likes13 downloads8mo agoHugging Face05lilgoose777 /tibetan-audio-english-6datasets-sample Tibetan Audio-English Sentence Dataset (Sample) This is a sample dataset containing 5 rows from a merged collection of 6 Tibetan audio datasets with English translations. 📊 Dataset Details Total Samples in Full Dataset: 17,278 Samples in This Preview: 5 Format: Audio + English sentence pairs Audio Sampling Rate: 16,000 Hz Languages: Tibetan (audio) → English (text) 🗂️ Source Datasets This sample is merged from 6 datasets:… See the full description on the dataset page: https://huggingface.co/datasets/lilgoose777/tibetan-audio-english-6datasets-sample.audioautomatic-speech-recognitionn<1K0 likes6 downloads8mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.