CoolFace
Datasetpublic

ramondomiingos/ptbr-irony-idioms-regionalism

Sotaques Digitais — Benchmark LLM Português Brasileiro Dataset Summary Sotaques Digitais é um benchmark de avaliação de competência pragmática e cultural para LLMs em português brasileiro. O dataset contém 90 cenários de teste distribuídos em três categorias linguísticas, construídos a partir de contextos reais (redes sociais, WhatsApp, atendimento ao cliente, avaliações de produto, ambiente de trabalho). O benchmark foi desenvolvido para a pesquisa "Sotaques… See the full description on the dataset page: https://huggingface.co/datasets/ramondomiingos/ptbr-irony-idioms-regionalism.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
1likes16downloads
Dataset Card

Sotaques Digitais — Benchmark LLM Português Brasileiro

Dataset Summary

Sotaques Digitais é um benchmark de avaliação de competência pragmática e cultural para LLMs em português brasileiro. O dataset contém 90 cenários de teste distribuídos em três categorias linguísticas, construídos a partir de contextos reais (redes sociais, WhatsApp, atendimento ao cliente, avaliações de produto, ambiente de trabalho).

O benchmark foi desenvolvido para a pesquisa "Sotaques Digitais: Uma Análise Comparativa da Compreensão de Ironia e Regionalismos Brasileiros entre o Sabiá-4 e LLMs Globais", que avalia e compara o modelo nacional Sabiá-4 (Maritaca AI) com GPT-4o-mini e Llama-3.

Supported Tasks and Leaderboards

  • —Interpretação pragmática: dado um texto com ironia, expressão idiomática ou regionalismo, o modelo deve produzir a interpretação correta segundo o ponto de vista de um falante nativo brasileiro.
  • —Avaliação por LLM-as-a-Judge: as respostas dos modelos são pontuadas de 1 a 5 com base nos gatilhos semânticos obrigatórios definidos nas Métricas de Sucesso.

Languages

Português brasileiro (pt-BR). Os cenários cobrem registros informais e formais, variações regionais das cinco macrorregiões do Brasil e linguagem característica de plataformas digitais.

Dataset Structure

Data Fields

CampoTipoDescrição
IDintIdentificador sequencial (1–90)
CategoriastringCategoria linguística (veja abaixo)
Texto de EntradastringPrompt com contexto real apresentado ao modelo
Gabarito EsperadostringInterpretação que um falante nativo brasileiro faria
Métricas de SucessostringGatilhos semânticos obrigatórios e tom/ação esperados para pontuação

Categorias

CategoriaExemplos de subcategoriaQtd.
IroniaSarcasmo em redes sociais, atendimento ao cliente, WhatsApp30
Expressão IdiomáticaExpressões figurativas do cotidiano brasileiro30
Regionalismo - NordesteVocabulário e expressões do Nordeste6
Regionalismo - SudesteVocabulário e expressões do Sudeste6
Regionalismo - SulVocabulário e expressões do Sul6
Regionalismo - Centro-OesteVocabulário e expressões do Centro-Oeste6
Regionalismo - NorteVocabulário e expressões do Norte6
Total90

Data Splits

O dataset não possui divisão train/test — é integralmente um conjunto de avaliação (evaluation set).

Dataset Creation

Curation Rationale

LLMs globais são treinados predominantemente em inglês e em português europeu/padrão. Este benchmark testa se modelos conseguem lidar com nuances pragmáticas e culturais específicas do português brasileiro: ironia implícita em contextos digitais, expressões idiomáticas sem equivalente literal e variações lexicais regionais — competências raramente avaliadas em benchmarks existentes.

Source Data

Os cenários foram criados manualmente, inspirados em situações autênticas de comunicação digital brasileira: publicações em redes sociais, conversas de WhatsApp, chats de atendimento ao cliente, avaliações de produto e interações em ambiente de trabalho.

Annotations

Cada entrada contém:

  • —Gabarito Esperado: interpretação de referência elaborada com base no conhecimento de falantes nativos.
  • —Métricas de Sucesso: lista de gatilhos semânticos (conceitos, classificações de sentimento, tom) que devem estar presentes em uma resposta correta, usados pelo juiz LLM para pontuar de 1 a 5.

Considerations for Using the Data

Social Impact

Benchmarks de língua portuguesa focados em pragmática e cultura regional são escassos. Este dataset contribui para o desenvolvimento de modelos mais competentes em português brasileiro, com impacto direto em aplicações de atendimento ao cliente, moderação de conteúdo e assistentes virtuais no mercado brasileiro.

Limitations

  • —O dataset cobre apenas o português brasileiro; não deve ser usado para avaliar português europeu.
  • —Os 30 cenários de regionalismo (6 por macrorregião) são uma amostra limitada da diversidade dialectal do Brasil.
  • —O gabarito reflete a interpretação majoritária de falantes nativos, mas pode existir variação individual.

Citation

Se você usar este dataset, por favor cite:

bibtex
@dataset{sotaques_digitais_2025,
  author    = {Domingos, Ramon},
  title     = {Sotaques Digitais: Benchmark de Ironia, Expressões Idiomáticas e Regionalismos do Português Brasileiro},
  year      = {2025},
  publisher = {Hugging Face},
  url       = {https://huggingface.co/datasets/ramon-domingos/sotaques-digitais}
}

License

Creative Commons Attribution 4.0 International (CC BY 4.0)