Titung/tibetan-audio-to-english-fixed-filtered
Tibetan audio translation Dataset Dataset Description Tibetan audio translation Dataset Dataset Summary This dataset contains 6,366 audio samples with corresponding transcriptions, totaling approximately 15.8 hours of audio. Languages The dataset is in EN (Language code: en). Dataset Structure Data Fields audio: An audio object containing: path: Path to the audio file (if applicable) array: Audio… See the full description on the dataset page: https://huggingface.co/datasets/Titung/tibetan-audio-to-english-fixed-filtered.
Tibetan audio translation Dataset
Dataset Description
Tibetan audio translation Dataset
Dataset Summary
This dataset contains 6,366 audio samples with corresponding transcriptions, totaling approximately 15.8 hours of audio.
Languages
The dataset is in EN (Language code: en).
Dataset Structure
Data Fields
audio: An audio object containing:path: Path to the audio file (if applicable)array: Audio waveform as a numpy arraysampling_rate: Sampling rate (16000 Hz)sentence: Transcription text corresponding to the audio
Data Splits
Dataset Statistics
Audio Characteristics
- Sampling Rate: 16000 Hz
- Total Samples: 6,366
- Total Duration: ~15.76 hours
- Duration Range: 5.00s - 15.91s
- Mean Duration: 8.91s
- Median Duration: 8.64s
Usage
Loading the Dataset
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("Titung/tibetan-audio-to-english-fixed-filtered")
# Access an example
example = dataset["train"][0]
print(example)Playing Audio
import IPython.display as ipd
# Play audio sample
audio = dataset["train"][0]["audio"]
ipd.Audio(audio["array"], rate=audio["sampling_rate"])Training with Transformers
from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC
# Load processor and model
processor = Wav2Vec2Processor.from_pretrained("facebook/wav2vec2-base")
model = Wav2Vec2ForCTC.from_pretrained("facebook/wav2vec2-base")
# Process audio
audio = dataset["train"][0]["audio"]["array"]
inputs = processor(audio, sampling_rate=16000, return_tensors="pt")Dataset Creation
Source Data
[Describe where your data comes from - e.g., "This dataset was created by processing audio files from..."]
Preprocessing
The audio files were:
- Resampled to 16000 Hz
- Converted to mono channel
- Normalized to float32 format
Considerations for Using the Data
Discussion of Biases
[Discuss any known biases in the dataset]
Other Known Limitations
[Mention any limitations users should be aware of]
Additional Information
Licensing Information
[Provide license information - this dataset uses cc-by-4.0]
Citation Information
If you use this dataset, please cite:
@dataset{your_dataset_2026,
author = {Your Name},
title = {Tibetan audio translation Dataset},
year = {2026},
publisher = {HuggingFace},
url = {https://huggingface.co/datasets/Titung/tibetan-audio-to-english-fixed-filtered}
}Contributions
[Add any acknowledgments or contribution information]
