CoolFace
Datasetpublic

HenriqueLz/fakerecogna2-extrativa-elections

FakeRecogna 2.0 (Extrativa) — Elections Temporal Split Versão com split temporal do dataset recogna-nlp/fakerecogna2-extrativa, estruturada especificamente para avaliação de concept drift, aprendizado contínuo/online (stream learning) e detecção de fake news no contexto eleitoral brasileiro. 📌 Visão Geral do Dataset Língua: Português Brasileiro (pt-BR) Total de Amostras: 52.535 notícias Critério de Divisão: Split temporal em 30/10/2021 (1 ano antes das Eleições… See the full description on the dataset page: https://huggingface.co/datasets/HenriqueLz/fakerecogna2-extrativa-elections.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes28downloads
Dataset Card

FakeRecogna 2.0 (Extrativa) — Elections Temporal Split

Versão com split temporal do dataset recogna-nlp/fakerecogna2-extrativa, estruturada especificamente para avaliação de concept drift, aprendizado contínuo/online (stream learning) e detecção de fake news no contexto eleitoral brasileiro.

📌 Visão Geral do Dataset

  • —Língua: Português Brasileiro (pt-BR)
  • —Total de Amostras: 52.535 notícias
  • —Critério de Divisão: Split temporal em 30/10/2021 (1 ano antes das Eleições Gerais de 2022 no Brasil).
  • —Objetivo: Treinar modelos no histórico anterior a 30/10/2021 e avaliar sua capacidade de generalização e adaptação ao fluxo contínuo de notícias do período eleitoral de 2022–2023.

📊 Estrutura dos Splits

SplitQuantidadePeríodo TemporalDescrição
`train`42.031Até 30/10/2021Conjunto pré-eleitoral para treino offline ou inicialização
`test`10.504Após 30/10/2021Fluxo de teste temporal cobrindo o período eleitoral de 2022/2023

🏷️ Distribuição de Classes

Label IDRótuloDescrição
0`VERDADEIRA`Notícia verdadeira / conteúdo factual verificado
1`FALSA`Notícia falsa / desinformação checada

🧬 Estrutura dos Dados (Features)

json
{
  "date": "2022-10-02 00:00:00",
  "labels": 1,
  "text": "Título da notícia. Subtítulo descritivo. Corpo da notícia completo..."
}
  • —`date` (timestamp[ns]): Data de publicação padronizada (YYYY-MM-DD).
  • —`labels` (int64): 0 para notícias verdadeiras e 1 para falsas.
  • —`text` (string): Concatenação de Título, Subtítulo e Notícia do corpus original FakeRecogna 2.0.

🚀 Como Usar

Com HuggingFace Datasets

python
from datasets import load_dataset

# Carregar ambos os splits (train e test)
dataset = load_dataset("HenriqueLz/fakerecogna2-extrativa-elections")

print(dataset)
# DatasetDict({
#     train: Dataset({ features: ['date', 'labels', 'text'], num_rows: 42031 }),
#     test: Dataset({ features: ['date', 'labels', 'text'], num_rows: 10504 })
# })

# Acessar exemplo
example = dataset["test"][0]
print(example["date"], example["labels"], example["text"][:100])

Com Pandas (Ordenação Temporal)

python
import pandas as pd
from datasets import load_dataset

ds = load_dataset("HenriqueLz/fakerecogna2-extrativa-elections")
df_test = ds["test"].to_pandas()

# Ordenar cronologicamente para avaliação de stream learning
df_test["date"] = pd.to_datetime(df_test["date"])
df_test = df_test.sort_values(by="date").reset_index(drop=True)

🔬 Pesquisa e Aplicações

Este dataset foi preparado e utilizado em pesquisas comparando:

  1. 1.Modelos Tradicionais vs. Aprendizado Online: BoW/TF-IDF com SGDClassifier, Naive Bayes e Passive-Aggressive em regime incremental (delayed, immediate, uncertainty).
  2. 2.Transformers Pré-treinados em PT-BR: Fine-tuning de modelos como NorBERTo-base, BERTimbau, Albertina, DeBERTinha e XLM-RoBERTa.

📖 Citação

Caso utilize este dataset, cite o trabalho original do FakeRecogna 2.0 apresentado no PROPOR 2024:

bibtex
@inproceedings{garcia-etal-2024-text,
    title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
    author = "Garcia, Gabriel Lino  and
      Paiola, Pedro Henrique  and
      Jodas, Danilo Samuel  and
      Sugi, Luis Afonso  and
      Papa, Jo{\~a}o Paulo",
    editor = "Gamallo, Pablo  and
      Claro, Daniela  and
      Teixeira, Ant{'o}nio  and
      Real, Livy  and
      Garcia, Marcos  and
      Oliveira, Hugo Gon{\c{c}}alo  and
      Amaro, Raquel",
    booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
    month = mar,
    year = "2024",
    address = "Santiago de Compostela, Galicia/Spain",
    publisher = "Association for Computational Lingustics",
    url = "https://aclanthology.org/2024.propor-1.9/",
    pages = "86--96"
}