ramondomiingos/ptbr-irony-idioms-regionalism
Sotaques Digitais — Benchmark LLM Português Brasileiro Dataset Summary Sotaques Digitais é um benchmark de avaliação de competência pragmática e cultural para LLMs em português brasileiro. O dataset contém 90 cenários de teste distribuídos em três categorias linguísticas, construídos a partir de contextos reais (redes sociais, WhatsApp, atendimento ao cliente, avaliações de produto, ambiente de trabalho). O benchmark foi desenvolvido para a pesquisa "Sotaques… See the full description on the dataset page: https://huggingface.co/datasets/ramondomiingos/ptbr-irony-idioms-regionalism.
Sotaques Digitais — Benchmark LLM Português Brasileiro
Dataset Summary
Sotaques Digitais é um benchmark de avaliação de competência pragmática e cultural para LLMs em português brasileiro. O dataset contém 90 cenários de teste distribuídos em três categorias linguísticas, construídos a partir de contextos reais (redes sociais, WhatsApp, atendimento ao cliente, avaliações de produto, ambiente de trabalho).
O benchmark foi desenvolvido para a pesquisa "Sotaques Digitais: Uma Análise Comparativa da Compreensão de Ironia e Regionalismos Brasileiros entre o Sabiá-4 e LLMs Globais", que avalia e compara o modelo nacional Sabiá-4 (Maritaca AI) com GPT-4o-mini e Llama-3.
Supported Tasks and Leaderboards
- Interpretação pragmática: dado um texto com ironia, expressão idiomática ou regionalismo, o modelo deve produzir a interpretação correta segundo o ponto de vista de um falante nativo brasileiro.
- Avaliação por LLM-as-a-Judge: as respostas dos modelos são pontuadas de 1 a 5 com base nos gatilhos semânticos obrigatórios definidos nas Métricas de Sucesso.
Languages
Português brasileiro (pt-BR). Os cenários cobrem registros informais e formais, variações regionais das cinco macrorregiões do Brasil e linguagem característica de plataformas digitais.
Dataset Structure
Data Fields
Categorias
Data Splits
O dataset não possui divisão train/test — é integralmente um conjunto de avaliação (evaluation set).
Dataset Creation
Curation Rationale
LLMs globais são treinados predominantemente em inglês e em português europeu/padrão. Este benchmark testa se modelos conseguem lidar com nuances pragmáticas e culturais específicas do português brasileiro: ironia implícita em contextos digitais, expressões idiomáticas sem equivalente literal e variações lexicais regionais — competências raramente avaliadas em benchmarks existentes.
Source Data
Os cenários foram criados manualmente, inspirados em situações autênticas de comunicação digital brasileira: publicações em redes sociais, conversas de WhatsApp, chats de atendimento ao cliente, avaliações de produto e interações em ambiente de trabalho.
Annotations
Cada entrada contém:
- Gabarito Esperado: interpretação de referência elaborada com base no conhecimento de falantes nativos.
- Métricas de Sucesso: lista de gatilhos semânticos (conceitos, classificações de sentimento, tom) que devem estar presentes em uma resposta correta, usados pelo juiz LLM para pontuar de 1 a 5.
Considerations for Using the Data
Social Impact
Benchmarks de língua portuguesa focados em pragmática e cultura regional são escassos. Este dataset contribui para o desenvolvimento de modelos mais competentes em português brasileiro, com impacto direto em aplicações de atendimento ao cliente, moderação de conteúdo e assistentes virtuais no mercado brasileiro.
Limitations
- O dataset cobre apenas o português brasileiro; não deve ser usado para avaliar português europeu.
- Os 30 cenários de regionalismo (6 por macrorregião) são uma amostra limitada da diversidade dialectal do Brasil.
- O gabarito reflete a interpretação majoritária de falantes nativos, mas pode existir variação individual.
Citation
Se você usar este dataset, por favor cite:
@dataset{sotaques_digitais_2025,
author = {Domingos, Ramon},
title = {Sotaques Digitais: Benchmark de Ironia, Expressões Idiomáticas e Regionalismos do Português Brasileiro},
year = {2025},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/ramon-domingos/sotaques-digitais}
}