fabriciosantana/discursos-senado-legislatura-56
Discursos da 56ª Legislatura do Senado Federal Visão geral Corpus de pronunciamentos do Plenário do Senado Federal relativos à 56ª Legislatura (2019–2023), coletados da API pública do Senado e consolidados em Parquet e CSV. Cada registro corresponde a um pronunciamento, com metadados e texto integral quando disponibilizado pela fonte. Versão atual Esta documentação corresponde à versão v1.1.1. Os arquivos de dados são os mesmos da versão v1.1.0; a… See the full description on the dataset page: https://huggingface.co/datasets/fabriciosantana/discursos-senado-legislatura-56.
Discursos da 56ª Legislatura do Senado Federal
Visão geral
Corpus de pronunciamentos do Plenário do Senado Federal relativos à 56ª Legislatura (2019–2023), coletados da API pública do Senado e consolidados em Parquet e CSV. Cada registro corresponde a um pronunciamento, com metadados e texto integral quando disponibilizado pela fonte.
Versão atual
Esta documentação corresponde à versão v1.1.1. Os arquivos de dados são os mesmos da versão v1.1.0; a atualização corrige e amplia o card e completa o manifesto de integridade.
- Janela solicitada à API: 2019-02-01 a 2023-01-31
- Datas observadas nos registros: 2019-02-01 a 2023-01-10
- Registros: 15.729
- Códigos de pronunciamento únicos: 15.729
- Textos integrais obtidos: 15.039
- Respostas HTTP 404 para texto integral: 690
- Resumos disponíveis como alternativa: 687
- Registros sem texto integral nem resumo: 3
- Duplicidades por código: 0
O conteúdo substantivo é equivalente ao da versão v1.0.0. A versão v1.1.0 normalizou a serialização e registrou, em __janela_inicio e __janela_fim, as janelas mensais efetivamente consultadas.
Arquivos
data/full/discursos_2019-02-01_2023-01-31.parquet: formato principal, colunar e comprimido.data/full/discursos_2019-02-01_2023-01-31.csv: alternativa para ferramentas sem suporte a Parquet.metadata/collection.json: manifesto da coleta, métricas e hashes SHA-256.
O repositório não define partições temáticas ou temporais. O único split técnico, train, contém o corpus completo; para avaliação de modelos, recomenda-se criar divisões próprias, preferencialmente respeitando a ordem temporal.
Estrutura dos dados
O dataset possui 30 colunas. Entre os campos principais estão:
CodigoPronunciamento,DataeCasa;NomeAutor,CodigoParlamentar,PartidoeUF;- campos aninhados de
TipoUsoPalavra; Resumo,IndexacaoeTextoDiscursoIntegral;ok,statusemsg, usados na auditoria do download do texto;__janela_inicioe__janela_fim, que identificam a janela mensal da consulta.
O idioma predominante é português do Brasil (pt-BR). Os registros sem texto integral foram preservados para manter a cobertura e permitir o uso de Resumo quando disponível.
Origem e processo de coleta
Os dados foram obtidos no Portal de Dados Abertos do Senado Federal por meio dos endpoints:
/plenario/lista/discursos/{AAAAMMDD}/{AAAAMMDD}.json;/discurso/texto-integral/{CodigoPronunciamento}.
O processo consistiu em:
- consultar a lista de discursos em janelas correspondentes a meses civis;
- baixar os textos integrais por
CodigoPronunciamento, com repetição e espera exponencial em falhas transitórias; - combinar os metadados e os resultados do download;
- normalizar o esquema e validar códigos, contagens e duplicidades;
- gerar os arquivos consolidados e o manifesto de integridade.
Ferramentas principais: requests, pandas e pyarrow.
O produtor original dos dados é o Senado Federal. Este repositório contém uma consolidação derivada para fins acadêmicos e de pesquisa.
Usos possíveis
- recuperação de informação e sistemas RAG;
- sumarização com indicação das fontes;
- classificação temática e análise de tendências;
- reconhecimento de entidades e redes de coocorrência;
- estudos exploratórios por período, partido ou unidade federativa.
Limitações e usos não recomendados
- A ausência de texto integral em 690 registros decorre de respostas HTTP 404 da fonte no momento da coleta.
- Discursos em Plenário não representam toda a atividade parlamentar.
- A estrutura e a disponibilidade da API podem mudar.
- Modelos de NLP podem introduzir vieses associados a partido, UF, gênero, região ou estilo discursivo.
- Não se recomenda inferir atributos pessoais sensíveis, produzir perfis individuais ou fazer afirmações causais sem desenho metodológico adequado.
- Resultados automatizados devem passar por validação humana amostral e conservar referências ao pronunciamento de origem.
Licença e atribuição
A consolidação e os arquivos produzidos neste repositório são disponibilizados sob a licença MIT. Os pronunciamentos são documentos públicos provenientes do Senado Federal; em qualquer reutilização, atribua a fonte oficial e verifique as condições aplicáveis no Portal de Dados Abertos.
Integridade e reprodutibilidade
Os hashes SHA-256 dos arquivos atuais são:
- Parquet:
e09cfc4793e5394be440906320c7d3008cda5a52b90bbc85bf47446362406af1 - CSV:
e5d79ca846a953058e5bb7a1acc9bd7aaf32629c6cfb1ade03d83991abff6066
As métricas completas estão em metadata/collection.json. Para reproduzir análises, registre a tag utilizada (v1.1.1) e o hash do arquivo consumido.
Citação sugerida
Santana, Fabricio Fernandes. Discursos da 56ª Legislatura do Senado Federal. Dataset derivado do Portal de Dados Abertos do Senado Federal, versão 1.1.1, 2026.
@dataset{santana_discursos_senado_56_2026,
author = {Santana, Fabricio Fernandes},
title = {Discursos da 56ª Legislatura do Senado Federal},
year = {2026},
version = {1.1.1},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/fabriciosantana/discursos-senado-legislatura-56},
note = {Dataset derivado do Portal de Dados Abertos do Senado Federal}
}