shraavb/spanish-slang-stt-data
Spanish Regional Speech-to-Text Dataset A multilingual Spanish speech recognition dataset covering 4 regional dialects for fine-tuning Whisper and other ASR models. Dataset Description This dataset contains ~39,000 audio samples with transcriptions across 4 Spanish-speaking regions: Region Samples Description Mexico 17,725 Mexican Spanish including CIEMPIESS corpus Spain 11,360 Castilian Spanish from TEDx and Common Voice Argentina 5,839 Rioplatense… See the full description on the dataset page: https://huggingface.co/datasets/shraavb/spanish-slang-stt-data.
Spanish Regional Speech-to-Text Dataset
A multilingual Spanish speech recognition dataset covering 4 regional dialects for fine-tuning Whisper and other ASR models.
Dataset Description
This dataset contains ~39,000 audio samples with transcriptions across 4 Spanish-speaking regions:
Intended Use
- Fine-tuning Whisper for regional Spanish dialects
- Training regional speech recognition models
- Studying dialectal variations in Spanish speech
Dataset Structure
Data Fields
Data Splits
How to Use
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("shraavb/spanish-slang-stt-data")
# Access training data
train_data = dataset["train"]
# Filter by region
mexico_samples = [s for s in train_data if s["region"] == "mexico"]
# Example sample
print(train_data[0])
# {
# 'audio_path': 'data/processed/mexico/ciempiess/sample.wav',
# 'transcript': 'Hola, buenos días',
# 'duration': 3.5,
# 'language': 'es',
# 'region': 'mexico',
# ...
# }Filter by Region
from datasets import load_dataset
dataset = load_dataset("shraavb/spanish-slang-stt-data")
# Get only Spanish (Castilian) samples
spain_train = dataset["train"].filter(lambda x: x["region"] == "spain")
print(f"Spain samples: {len(spain_train)}")Source Datasets
Audio Specifications
- Sample Rate: 16,000 Hz
- Format: WAV (mono)
- Duration Range: 0.5s - 30s (filtered for Whisper compatibility)
Training Scripts
See spanish-slang-stt for:
- Fine-tuning scripts for Whisper
- Regional model training (Approach 2)
- Evaluation scripts
Citation
@misc{spanish-slang-stt-2024,
title={Spanish Regional Speech-to-Text Dataset},
author={Shraavasti Bhat},
year={2024},
url={https://huggingface.co/datasets/shraavb/spanish-slang-stt-data}
}License
This dataset is released under CC-BY-4.0. Individual source datasets may have additional restrictions (see Source Datasets table).
