datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Bangor-Miami-Spanish-English-Corpus
Bangor Miami Spanish-English Corpus
The Bangor Miami Corpus is a naturalistic Spanish-English code-switching speech dataset collected by Jon Russell Herring at Bangor University. It captures spontaneous bilingual conversations recorded in Miami, Florida, involving proficient Spanish-English bilinguals across multiple speaker groups.
Dataset description
Total recordings
56
Total duration
~32 h
Languages
English (en), Spanish (es)
Format
MP3 audio +… See the full description on the dataset page: https://huggingface.co/datasets/BrunoHays/Bangor-Miami-Spanish-English-Corpus.audio-mia-batch-20260312
Audio MIA Batch 20260312
This dataset contains 6,998 audio files (64 GB) downloaded from YouTube videos.
Dataset Structure
Each row contains:
audio: Audio bytes (playable in the dataset viewer)
video_id: YouTube video ID
category: Content category
source_term: Search term used
query: Full search query
title: Video title
url: YouTube URL
uploader: Channel name
channel_id: YouTube channel ID
upload_date: Upload date (YYYY-MM-DD)
duration: Video duration in seconds… See the full description on the dataset page: https://huggingface.co/datasets/potsawee/audio-mia-batch-20260312.
