datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
training-movies-test-stuffmovies800time
movies800time
Audio validation set organized as validation/audio/* plus validation/metadata.jsonl. The metadata contains only file_name and transcription; transcriptions include timestamp and speaker markers.
movies800
moss_movies800
Audio validation set organized as validation/audio/* plus validation/metadata.jsonl. The metadata contains only file_name and transcription.
ati-rose-movies-x7q2k9mOE-DCT-Movie-clipstelugu-movies-speechmovieAudioHindi_movie-1.5hrsHindi_movie-1.5hrs_unslothlagumoviegen-dataset-version-2acholi-english-movie-dialogue
Acholi English Movie Dialogue Dataset
📚 Thesis Dataset - Currently Private
A Bilingual English-Acholi speech translation dataset with paired audio and transcripts from movie dialogue across multiple genres. Created for developing offline speech translation systems.
Created by: Acellam GuyThesis Title: Offline Speech Translation System for English Movies into Acholi Using AI TechniquesStatus: Private (until thesis presentation in 2026)HuggingFace Profile:… See the full description on the dataset page: https://huggingface.co/datasets/acellam/acholi-english-movie-dialogue.
