thiagomonteles/BIPA
BIPA — Brazilian Portuguese Pronunciation Dataset (IPA) Description A grapheme-to-phoneme (G2P) dataset for Brazilian Portuguese, with transcriptions in the International Phonetic Alphabet (IPA) and dialectal labels, derived from Wiktionary under CC BY-SA 4.0. Includes consistent symbol normalization (inventory: 107 segmental letters, 44 diacritics) and standardization of dialectal labels. Paper: BIPA: Brazilian Portuguese Phonetic Dataset with Dialectal… See the full description on the dataset page: https://huggingface.co/datasets/thiagomonteles/BIPA.
BIPA — Brazilian Portuguese Pronunciation Dataset (IPA)
Description
A grapheme-to-phoneme (G2P) dataset for Brazilian Portuguese, with transcriptions in the International Phonetic Alphabet (IPA) and dialectal labels, derived from Wiktionary under CC BY-SA 4.0. Includes consistent symbol normalization (inventory: 107 segmental letters, 44 diacritics) and standardization of dialectal labels.
Paper: BIPA: Brazilian Portuguese Phonetic Dataset with Dialectal Variations in IPA Standard
Statistics
- Unique words: 53,353
- Total transcriptions: 350,021
- Distribution by dialect:
- Brazil (general): 52.67%
- Rio de Janeiro: 22.51%
- São Paulo: 14.71%
- South Region: 9.98%
- Northeast Region: 0.10%
- Center-West Region: 0.02%
- Extraction date: 09/17/2025
How to Cite
If you use this dataset, please cite the following paper:
Thiago Monteles de Sousa, Lucas Rafael Gris, and Nádia Félix Felipe da Silva. 2026. BIPA: Brazilian Portuguese Phonetic Dataset with Dialectal Variations in IPA Standard. In Proceedings of the 17th International Conference on Computational Processing of Portuguese (PROPOR 2026) - Vol. 1, pages 478–487, Salvador, Brazil. Association for Computational Linguistics.
