lucianfialho/atos-de-fala-ptbr-dataset
Atos de Fala PT-BR Dataset de atos de fala (speech acts) anotados em nível de span para o português brasileiro. Cada exemplo é uma frase com um ou mais trechos marcados, e cada trecho recebe um rótulo de ato de fala — o que a pessoa está fazendo com aquele pedaço de texto (pedir, perguntar, concordar, etc.), não apenas o que ele significa. A base teórica é a pragmática: atos de fala (Searle) alinhados ao inventário de dialogue acts da ISO 24617-2. Formato JSONL… See the full description on the dataset page: https://huggingface.co/datasets/lucianfialho/atos-de-fala-ptbr-dataset.
Atos de Fala PT-BR
Dataset de atos de fala (speech acts) anotados em nível de span para o português brasileiro. Cada exemplo é uma frase com um ou mais trechos marcados, e cada trecho recebe um rótulo de ato de fala — o que a pessoa está fazendo com aquele pedaço de texto (pedir, perguntar, concordar, etc.), não apenas o que ele significa.
A base teórica é a pragmática: atos de fala (Searle) alinhados ao inventário de dialogue acts da ISO 24617-2.
Formato
JSONL, um exemplo por linha:
{"text": "Bom dia! Você pode me revisar o relatório? Obrigado.",
"spans": [
{"start": 0, "end": 8, "act": "saudar"},
{"start": 9, "end": 42, "act": "pedir"},
{"start": 43, "end": 52, "act": "agradecer"}
]}text— a frase completa (string).spans— lista de trechos.start/endsão offsets de caractere (semi-abertos,text[start:end]);acté o rótulo do ato.
Taxonomia (13 atos)
informar, perguntar, concordar, discordar, pedir, sugerir, oferecer, prometer, saudar, agradecer, desculpar, despedir, expressar_emocao.
Estatísticas (v1)
Distribuição por ato:
Como foi construído (e o que esperar)
Esta é a v1, sintética: as frases foram geradas e anotadas por um pipeline com um modelo professor (LLM) sob uma rubrica fixa com casos de borda, com adjudicação automática nos casos ambíguos. É um ponto de partida para treinar e avaliar — não é gold humano.
Vieses conhecidos:
- Atos de "andaime" conversacional (
saudar,agradecer,pedir) estão super-representados porque aparecem naturalmente em aberturas/fechamentos de diálogo. Use com cautela em tarefas sensíveis a balanço de classe. - Por ser sintético, o vocabulário e os registros são menos diversos que texto real.
Uma coleta de anotações humanas (gold) está em andamento via um jogo público de anotação, inclusive medindo se perfis demográficos diferentes percebem atos de fala diferentes na mesma frase. Versões futuras vão incorporar esses dados.
Modelo treinado neste dataset
`lucianfialho/atos-de-fala-ptbr` — classificador de tokens (BERTimbau + LoRA, esquema BIOES) treinado sobre estes dados. Roda no navegador via Transformers.js/WebGPU.
Licença
CC BY 4.0 — use livremente, só cite a fonte.
Citação
@misc{atos-de-fala-ptbr-2026,
title = {Atos de Fala PT-BR: span-level speech-act annotations for Brazilian Portuguese},
author = {Fialho, Lucian},
year = {2026},
howpublished = {Hugging Face Datasets}
}Contato: lucian@metricasboss.com.br
