CoolFace
Datasetpublic

shraavb/spanish-slang-stt-data

Spanish Regional Speech-to-Text Dataset A multilingual Spanish speech recognition dataset covering 4 regional dialects for fine-tuning Whisper and other ASR models. Dataset Description This dataset contains ~39,000 audio samples with transcriptions across 4 Spanish-speaking regions: Region Samples Description Mexico 17,725 Mexican Spanish including CIEMPIESS corpus Spain 11,360 Castilian Spanish from TEDx and Common Voice Argentina 5,839 Rioplatense… See the full description on the dataset page: https://huggingface.co/datasets/shraavb/spanish-slang-stt-data.

sourceHugging Facecc-by-4.0updated 9mo agoView on Hugging Face
0likes1.3kdownloads
Dataset Card

Spanish Regional Speech-to-Text Dataset

A multilingual Spanish speech recognition dataset covering 4 regional dialects for fine-tuning Whisper and other ASR models.

Dataset Description

This dataset contains ~39,000 audio samples with transcriptions across 4 Spanish-speaking regions:

RegionSamplesDescription
Mexico17,725Mexican Spanish including CIEMPIESS corpus
Spain11,360Castilian Spanish from TEDx and Common Voice
Argentina5,839Rioplatense Spanish from OpenSLR
Chile4,374Chilean Spanish from OpenSLR

Intended Use

  • —Fine-tuning Whisper for regional Spanish dialects
  • —Training regional speech recognition models
  • —Studying dialectal variations in Spanish speech

Dataset Structure

Data Fields

FieldTypeDescription
audio_pathstringRelative path to audio file
transcriptstringText transcription
durationfloatAudio duration in seconds
languagestringLanguage code (es)
regionstringGeographic region (mexico, spain, argentina, chile)
datasetstringSource dataset name
original_pathstringOriginal file path
dialect_markerslistRegional dialect indicators (optional)
speaker_idstringSpeaker identifier (where available)

Data Splits

SplitSamples
Train31,438
Validation3,929
Test3,931

How to Use

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("shraavb/spanish-slang-stt-data")

# Access training data
train_data = dataset["train"]

# Filter by region
mexico_samples = [s for s in train_data if s["region"] == "mexico"]

# Example sample
print(train_data[0])
# {
#   'audio_path': 'data/processed/mexico/ciempiess/sample.wav',
#   'transcript': 'Hola, buenos días',
#   'duration': 3.5,
#   'language': 'es',
#   'region': 'mexico',
#   ...
# }

Filter by Region

python
from datasets import load_dataset

dataset = load_dataset("shraavb/spanish-slang-stt-data")

# Get only Spanish (Castilian) samples
spain_train = dataset["train"].filter(lambda x: x["region"] == "spain")
print(f"Spain samples: {len(spain_train)}")

Source Datasets

DatasetRegionLicense
CIEMPIESSMexicoCC BY-NC-SA 4.0
TEDx SpanishSpainCC BY-NC-ND 4.0
Common VoiceSpain, Mexico, ArgentinaCC0
OpenSLR ArgentineArgentinaCC BY 4.0
OpenSLR ChileanChileCC BY 4.0

Audio Specifications

  • —Sample Rate: 16,000 Hz
  • —Format: WAV (mono)
  • —Duration Range: 0.5s - 30s (filtered for Whisper compatibility)

Training Scripts

See spanish-slang-stt for:

  • —Fine-tuning scripts for Whisper
  • —Regional model training (Approach 2)
  • —Evaluation scripts

Citation

bibtex
@misc{spanish-slang-stt-2024,
  title={Spanish Regional Speech-to-Text Dataset},
  author={Shraavasti Bhat},
  year={2024},
  url={https://huggingface.co/datasets/shraavb/spanish-slang-stt-data}
}

License

This dataset is released under CC-BY-4.0. Individual source datasets may have additional restrictions (see Source Datasets table).

shraavb/spanish-slang-stt-data · CoolFace