datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
voxceleb2
VoxCeleb2 Dataset
This is the VoxCeleb2 dataset, a large-scale speaker identification dataset.
Dataset Description
VoxCeleb2 contains over 1 million utterances for 6,112 celebrities, extracted from videos uploaded to YouTube.
Files
vox2_dev_mp4_part*: Multipart archive containing MP4 video files
vox2_dev_txt: Text files with speaker/utterance metadata
vox2_meta.csv: Dataset metadata
Usage
To extract the multipart archive:
# Using 7zip
7z x… See the full description on the dataset page: https://huggingface.co/datasets/Reverb/voxceleb2.reverb-asr-dataset-0.4
Reverb Asr Dataset
Dataset Description
This dataset contains 30 samples organized across multiple splits and 2 subsets.
The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
pointsource_noises: 15 samples
train: 15 samples
real_rirs_isotropic_noises: 15 samples
train: 15 samples
Usage
Load specific subset and split:
from datasets import load_dataset
# Load specific subset and split… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/reverb-asr-dataset-0.4.hundred-reverb-asr-dataset-0.4
Reverb Asr Dataset
Dataset Description
This dataset contains 300 samples organized across multiple splits and 3 subsets.
The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
original: 100 samples
train: 100 samples
pointsource_noises: 100 samples
train: 100 samples
real_rirs_isotropic_noises: 100 samples
train: 100 samples
Usage
Load specific subset and split:
from datasets import… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/hundred-reverb-asr-dataset-0.4.sub-reverb-asr-dataset-0.4
Reverb Asr Dataset
Dataset Description
This dataset contains 45 samples organized across multiple splits and 3 subsets.
The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
original: 15 samples
train: 15 samples
pointsource_noises: 15 samples
train: 15 samples
real_rirs_isotropic_noises: 15 samples
train: 15 samples
Usage
Load specific subset and split:
from datasets import… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/sub-reverb-asr-dataset-0.4.taper-reverb-asr-dataset-0.5
Reverb Asr Dataset
Dataset Description
This dataset contains 45 samples organized across multiple splits and 3 subsets.
The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
original: 15 samples
train: 15 samples
pointsource_noises: 15 samples
train: 15 samples
real_rirs_isotropic_noises: 15 samples
train: 15 samples
Usage
Load specific subset and split:
from datasets import… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/taper-reverb-asr-dataset-0.5.reverb-asr-dataset-0.8
Reverb Asr Dataset
Dataset Description
This dataset contains 30 samples organized across multiple splits and 2 subsets.
The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
pointsource_noises: 15 samples
train: 15 samples
real_rirs_isotropic_noises: 15 samples
train: 15 samples
Usage
Load specific subset and split:
from datasets import load_dataset
# Load specific subset and split… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/reverb-asr-dataset-0.8.room_sim_reverb_dataset
Room Sim Reverb Dataset
Dataset Description
This dataset contains 100 samples organized across multiple splits and 1 subsets.
The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
room_simulator: 100 samples
train: 100 samples
Usage
Load specific subset and split:
from datasets import load_dataset
# Load specific subset and split
dataset =… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/room_sim_reverb_dataset.
