CoolFace
Datasetpublic

fabriciosantana/discursos-senado-legislatura-56

Discursos da 56ª Legislatura do Senado Federal Visão geral Corpus de pronunciamentos do Plenário do Senado Federal relativos à 56ª Legislatura (2019–2023), coletados da API pública do Senado e consolidados em Parquet e CSV. Cada registro corresponde a um pronunciamento, com metadados e texto integral quando disponibilizado pela fonte. Versão atual Esta documentação corresponde à versão v1.1.1. Os arquivos de dados são os mesmos da versão v1.1.0; a… See the full description on the dataset page: https://huggingface.co/datasets/fabriciosantana/discursos-senado-legislatura-56.

sourceHugging Facemitupdated 1mo agoView on Hugging Face
1likes68downloads
Dataset Card

Discursos da 56ª Legislatura do Senado Federal

Visão geral

Corpus de pronunciamentos do Plenário do Senado Federal relativos à 56ª Legislatura (2019–2023), coletados da API pública do Senado e consolidados em Parquet e CSV. Cada registro corresponde a um pronunciamento, com metadados e texto integral quando disponibilizado pela fonte.

Versão atual

Esta documentação corresponde à versão v1.1.1. Os arquivos de dados são os mesmos da versão v1.1.0; a atualização corrige e amplia o card e completa o manifesto de integridade.

  • —Janela solicitada à API: 2019-02-01 a 2023-01-31
  • —Datas observadas nos registros: 2019-02-01 a 2023-01-10
  • —Registros: 15.729
  • —Códigos de pronunciamento únicos: 15.729
  • —Textos integrais obtidos: 15.039
  • —Respostas HTTP 404 para texto integral: 690
  • —Resumos disponíveis como alternativa: 687
  • —Registros sem texto integral nem resumo: 3
  • —Duplicidades por código: 0

O conteúdo substantivo é equivalente ao da versão v1.0.0. A versão v1.1.0 normalizou a serialização e registrou, em __janela_inicio e __janela_fim, as janelas mensais efetivamente consultadas.

Arquivos

  • —data/full/discursos_2019-02-01_2023-01-31.parquet: formato principal, colunar e comprimido.
  • —data/full/discursos_2019-02-01_2023-01-31.csv: alternativa para ferramentas sem suporte a Parquet.
  • —metadata/collection.json: manifesto da coleta, métricas e hashes SHA-256.

O repositório não define partições temáticas ou temporais. O único split técnico, train, contém o corpus completo; para avaliação de modelos, recomenda-se criar divisões próprias, preferencialmente respeitando a ordem temporal.

Estrutura dos dados

O dataset possui 30 colunas. Entre os campos principais estão:

  • —CodigoPronunciamento, Data e Casa;
  • —NomeAutor, CodigoParlamentar, Partido e UF;
  • —campos aninhados de TipoUsoPalavra;
  • —Resumo, Indexacao e TextoDiscursoIntegral;
  • —ok, status e msg, usados na auditoria do download do texto;
  • —__janela_inicio e __janela_fim, que identificam a janela mensal da consulta.

O idioma predominante é português do Brasil (pt-BR). Os registros sem texto integral foram preservados para manter a cobertura e permitir o uso de Resumo quando disponível.

Origem e processo de coleta

Os dados foram obtidos no Portal de Dados Abertos do Senado Federal por meio dos endpoints:

  • —/plenario/lista/discursos/{AAAAMMDD}/{AAAAMMDD}.json;
  • —/discurso/texto-integral/{CodigoPronunciamento}.

O processo consistiu em:

  1. 1.consultar a lista de discursos em janelas correspondentes a meses civis;
  2. 2.baixar os textos integrais por CodigoPronunciamento, com repetição e espera exponencial em falhas transitórias;
  3. 3.combinar os metadados e os resultados do download;
  4. 4.normalizar o esquema e validar códigos, contagens e duplicidades;
  5. 5.gerar os arquivos consolidados e o manifesto de integridade.

Ferramentas principais: requests, pandas e pyarrow.

O produtor original dos dados é o Senado Federal. Este repositório contém uma consolidação derivada para fins acadêmicos e de pesquisa.

Usos possíveis

  • —recuperação de informação e sistemas RAG;
  • —sumarização com indicação das fontes;
  • —classificação temática e análise de tendências;
  • —reconhecimento de entidades e redes de coocorrência;
  • —estudos exploratórios por período, partido ou unidade federativa.

Limitações e usos não recomendados

  • —A ausência de texto integral em 690 registros decorre de respostas HTTP 404 da fonte no momento da coleta.
  • —Discursos em Plenário não representam toda a atividade parlamentar.
  • —A estrutura e a disponibilidade da API podem mudar.
  • —Modelos de NLP podem introduzir vieses associados a partido, UF, gênero, região ou estilo discursivo.
  • —Não se recomenda inferir atributos pessoais sensíveis, produzir perfis individuais ou fazer afirmações causais sem desenho metodológico adequado.
  • —Resultados automatizados devem passar por validação humana amostral e conservar referências ao pronunciamento de origem.

Licença e atribuição

A consolidação e os arquivos produzidos neste repositório são disponibilizados sob a licença MIT. Os pronunciamentos são documentos públicos provenientes do Senado Federal; em qualquer reutilização, atribua a fonte oficial e verifique as condições aplicáveis no Portal de Dados Abertos.

Integridade e reprodutibilidade

Os hashes SHA-256 dos arquivos atuais são:

  • —Parquet: e09cfc4793e5394be440906320c7d3008cda5a52b90bbc85bf47446362406af1
  • —CSV: e5d79ca846a953058e5bb7a1acc9bd7aaf32629c6cfb1ade03d83991abff6066

As métricas completas estão em metadata/collection.json. Para reproduzir análises, registre a tag utilizada (v1.1.1) e o hash do arquivo consumido.

Citação sugerida

Santana, Fabricio Fernandes. Discursos da 56ª Legislatura do Senado Federal. Dataset derivado do Portal de Dados Abertos do Senado Federal, versão 1.1.1, 2026.
bibtex
@dataset{santana_discursos_senado_56_2026,
  author    = {Santana, Fabricio Fernandes},
  title     = {Discursos da 56ª Legislatura do Senado Federal},
  year      = {2026},
  version   = {1.1.1},
  publisher = {Hugging Face},
  url       = {https://huggingface.co/datasets/fabriciosantana/discursos-senado-legislatura-56},
  note      = {Dataset derivado do Portal de Dados Abertos do Senado Federal}
}