CoolFace
Datasetpublic

AAdonis/multilingual_audio_alignments

Multilingual MFA-Aligned Speech Dataset A large-scale multilingual speech dataset with word-level and phoneme-level alignments produced using the Montreal Forced Aligner (MFA). Dataset Description This dataset consolidates multiple speech corpora across various languages, all processed through MFA to provide precise phoneme and word alignments. Each sample includes the original audio, transcript, and detailed timing information for both words and phonemes.… See the full description on the dataset page: https://huggingface.co/datasets/AAdonis/multilingual_audio_alignments.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
27likes3.5kdownloads
Dataset Card

Multilingual MFA-Aligned Speech Dataset

A large-scale multilingual speech dataset with word-level and phoneme-level alignments produced using the Montreal Forced Aligner (MFA).

Dataset Description

This dataset consolidates multiple speech corpora across various languages, all processed through MFA to provide precise phoneme and word alignments. Each sample includes the original audio, transcript, and detailed timing information for both words and phonemes.

Features

ColumnTypeDescription
audioAudioAudio waveform at 16kHz
transcriptstringText transcription
phoneme_sequencestringPhoneme sequence with spaces between words
wordslistWord-level alignments: [{word, start, end}, ...]
phonemeslistPhoneme-level alignments: [{phoneme, start, end}, ...]
sourcestringOriginal dataset source (e.g., voxpopuli, common_voice)

Languages & Statistics

LanguageConfigHoursSamplesSources
EnglishenglishTBDTBDCommon Voice, VoxPopuli, GigaSpeech, Emilia, Genshin Voice, Gemini Speech
GermangermanTBDTBDMultilingual LibriSpeech, Emilia
FrenchfrenchTBDTBDFrench Game Voice, Multilingual LibriSpeech, Wolof French ASR
SpanishspanishTBDTBDCML TTS, LibriVox, TEDx Spanish
RussianrussianTBDTBDRussian Audio Data, Multilingual LibriSpeech
JapanesejapaneseTBDTBDCombined Japanese Dataset, Japanese Anime Speech
KoreankoreanTBDTBDZeroth STT Korean, Korea Speech
PortugueseportugueseTBDTBDPortuguese TTS, Multilingual LibriSpeech
TurkishturkishTBDTBDTurkish Merge Audio, Khan Academy Turkish
ThaithaiTBDTBDPorjai Thai Voice Dataset

Total: ~20,000+ hours (estimated)

Usage

Load a specific language

python
from datasets import load_dataset

# Load English data
dataset = load_dataset("AAdonis/multilingual_audio_alignments", "english", split="train")

# Load German data
dataset = load_dataset("AAdonis/multilingual_audio_alignments", "german", split="train")

Access alignments

python
sample = dataset[0]

# Get audio
audio = sample["audio"]["array"]
sample_rate = sample["audio"]["sampling_rate"]

# Get transcript, phonemes, and source
transcript = sample["transcript"]
phonemes = sample["phoneme_sequence"]  # "h ɛ l oʊ w ɜː l d"
source = sample["source"]  # e.g., "voxpopuli"

# Get word-level alignments
for word_info in sample["words"]:
    print(f"{word_info['word']}: {word_info['start']:.2f}s - {word_info['end']:.2f}s")

# Get phoneme-level alignments
for phon_info in sample["phonemes"]:
    print(f"{phon_info['phoneme']}: {phon_info['start']:.3f}s - {phon_info['end']:.3f}s")

Filter by source

python
# Get only VoxPopuli samples
voxpopuli_samples = dataset.filter(lambda x: x["source"] == "voxpopuli")

# Get only Common Voice samples
cv_samples = dataset.filter(lambda x: x["source"] == "common_voice")

Processing Details

MFA Alignment

All samples were aligned using the Montreal Forced Aligner (MFA) with language-specific acoustic models and pronunciation dictionaries.

Quality Filtering

During processing, samples were filtered and split based on:

  • `<unk>` words: Samples containing unknown words are split at those boundaries
  • `spn` phonemes: Spoken noise markers cause sample splits
  • Duration: Samples are filtered by minimum/maximum duration thresholds
  • Word count: Minimum word requirements per segment

Phoneme Sequence Format

The phoneme_sequence column contains IPA phonemes with:

  • Phonemes within a word are concatenated directly
  • Words are separated by spaces
  • Example: "h ɛ l oʊ" for "hello" (4 phonemes, 1 word)

Citation

If you use this dataset in your research, please cite the following manuscript:

bibtex
@misc{aasonitis2026multilingualspeechediting,
      title={Multilingual Speech Editing},
      author={Antonis Asonitis and Luca A. Lanzendörfer and Frédéric Berdoz and Roger Wattenhofer},
      year={2026},
      note={Manuscript in preparation},
}

License

This dataset is released under CC-BY-4.0. Please also respect the licenses of the original source datasets and MFA.