CoolFace
Datasetpublic

thiagomonteles/BIPA

BIPA — Brazilian Portuguese Pronunciation Dataset (IPA) Description A grapheme-to-phoneme (G2P) dataset for Brazilian Portuguese, with transcriptions in the International Phonetic Alphabet (IPA) and dialectal labels, derived from Wiktionary under CC BY-SA 4.0. Includes consistent symbol normalization (inventory: 107 segmental letters, 44 diacritics) and standardization of dialectal labels. Paper: BIPA: Brazilian Portuguese Phonetic Dataset with Dialectal… See the full description on the dataset page: https://huggingface.co/datasets/thiagomonteles/BIPA.

sourceHugging Facecc-by-sa-4.0updated 5mo agoView on Hugging Face
1likes18downloads
Dataset Card

BIPA — Brazilian Portuguese Pronunciation Dataset (IPA)

Description

A grapheme-to-phoneme (G2P) dataset for Brazilian Portuguese, with transcriptions in the International Phonetic Alphabet (IPA) and dialectal labels, derived from Wiktionary under CC BY-SA 4.0. Includes consistent symbol normalization (inventory: 107 segmental letters, 44 diacritics) and standardization of dialectal labels.

Paper: BIPA: Brazilian Portuguese Phonetic Dataset with Dialectal Variations in IPA Standard

Statistics

  • —Unique words: 53,353
  • —Total transcriptions: 350,021
  • —Distribution by dialect:
  • —Brazil (general): 52.67%
  • —Rio de Janeiro: 22.51%
  • —São Paulo: 14.71%
  • —South Region: 9.98%
  • —Northeast Region: 0.10%
  • —Center-West Region: 0.02%
  • —Extraction date: 09/17/2025

How to Cite

If you use this dataset, please cite the following paper:

Thiago Monteles de Sousa, Lucas Rafael Gris, and Nádia Félix Felipe da Silva. 2026. BIPA: Brazilian Portuguese Phonetic Dataset with Dialectal Variations in IPA Standard. In Proceedings of the 17th International Conference on Computational Processing of Portuguese (PROPOR 2026) - Vol. 1, pages 478–487, Salvador, Brazil. Association for Computational Linguistics.