CoolFace
Datasetpublic

Titung/tibetan-audio-to-english-fixed-filtered

Tibetan audio translation Dataset Dataset Description Tibetan audio translation Dataset Dataset Summary This dataset contains 6,366 audio samples with corresponding transcriptions, totaling approximately 15.8 hours of audio. Languages The dataset is in EN (Language code: en). Dataset Structure Data Fields audio: An audio object containing: path: Path to the audio file (if applicable) array: Audio… See the full description on the dataset page: https://huggingface.co/datasets/Titung/tibetan-audio-to-english-fixed-filtered.

sourceHugging Facecc-by-4.0updated 8mo agoView on Hugging Face
0likes27downloads
Dataset Card

Tibetan audio translation Dataset

Dataset Description

Tibetan audio translation Dataset

Dataset Summary

This dataset contains 6,366 audio samples with corresponding transcriptions, totaling approximately 15.8 hours of audio.

Languages

The dataset is in EN (Language code: en).

Dataset Structure

Data Fields

  • —audio: An audio object containing:
  • —path: Path to the audio file (if applicable)
  • —array: Audio waveform as a numpy array
  • —sampling_rate: Sampling rate (16000 Hz)
  • —sentence: Transcription text corresponding to the audio

Data Splits

SplitExamples
train6,366

Dataset Statistics

Audio Characteristics

  • —Sampling Rate: 16000 Hz
  • —Total Samples: 6,366
  • —Total Duration: ~15.76 hours
  • —Duration Range: 5.00s - 15.91s
  • —Mean Duration: 8.91s
  • —Median Duration: 8.64s

Usage

Loading the Dataset

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("Titung/tibetan-audio-to-english-fixed-filtered")

# Access an example
example = dataset["train"][0]
print(example)

Playing Audio

python
import IPython.display as ipd

# Play audio sample
audio = dataset["train"][0]["audio"]
ipd.Audio(audio["array"], rate=audio["sampling_rate"])

Training with Transformers

python
from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC

# Load processor and model
processor = Wav2Vec2Processor.from_pretrained("facebook/wav2vec2-base")
model = Wav2Vec2ForCTC.from_pretrained("facebook/wav2vec2-base")

# Process audio
audio = dataset["train"][0]["audio"]["array"]
inputs = processor(audio, sampling_rate=16000, return_tensors="pt")

Dataset Creation

Source Data

[Describe where your data comes from - e.g., "This dataset was created by processing audio files from..."]

Preprocessing

The audio files were:

  • —Resampled to 16000 Hz
  • —Converted to mono channel
  • —Normalized to float32 format

Considerations for Using the Data

Discussion of Biases

[Discuss any known biases in the dataset]

Other Known Limitations

[Mention any limitations users should be aware of]

Additional Information

Licensing Information

[Provide license information - this dataset uses cc-by-4.0]

Citation Information

If you use this dataset, please cite:

bibtex
@dataset{your_dataset_2026,
  author = {Your Name},
  title = {Tibetan audio translation Dataset},
  year = {2026},
  publisher = {HuggingFace},
  url = {https://huggingface.co/datasets/Titung/tibetan-audio-to-english-fixed-filtered}
}

Contributions

[Add any acknowledgments or contribution information]