mahesh27/mms-300m-xsampa-doreco
052
Phoneme model (X-SAMPA) for 45 languages from DoReCo. Alignments can be performed using ctc-segmentation (following Wav2vec2 example code under 'Usage').
Citation
@article{akavarapu2026phoneme,
title={Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation},
author={Akavarapu, V.S.D.S.Mahesh and Daniel, Michael and J{\"a}ger, Gerhard},
year={2026},
journal={arXiv preprint arXiv:2608.28508},
url={https://arxiv.org/abs/2608.28508},
}