HenriqueLz/fakerecogna2-extrativa-elections
FakeRecogna 2.0 (Extrativa) — Elections Temporal Split Versão com split temporal do dataset recogna-nlp/fakerecogna2-extrativa, estruturada especificamente para avaliação de concept drift, aprendizado contínuo/online (stream learning) e detecção de fake news no contexto eleitoral brasileiro. 📌 Visão Geral do Dataset Língua: Português Brasileiro (pt-BR) Total de Amostras: 52.535 notícias Critério de Divisão: Split temporal em 30/10/2021 (1 ano antes das Eleições… See the full description on the dataset page: https://huggingface.co/datasets/HenriqueLz/fakerecogna2-extrativa-elections.
FakeRecogna 2.0 (Extrativa) — Elections Temporal Split
Versão com split temporal do dataset recogna-nlp/fakerecogna2-extrativa, estruturada especificamente para avaliação de concept drift, aprendizado contínuo/online (stream learning) e detecção de fake news no contexto eleitoral brasileiro.
📌 Visão Geral do Dataset
- Língua: Português Brasileiro (
pt-BR) - Total de Amostras: 52.535 notícias
- Critério de Divisão: Split temporal em 30/10/2021 (1 ano antes das Eleições Gerais de 2022 no Brasil).
- Objetivo: Treinar modelos no histórico anterior a 30/10/2021 e avaliar sua capacidade de generalização e adaptação ao fluxo contínuo de notícias do período eleitoral de 2022–2023.
📊 Estrutura dos Splits
🏷️ Distribuição de Classes
🧬 Estrutura dos Dados (Features)
{
"date": "2022-10-02 00:00:00",
"labels": 1,
"text": "Título da notícia. Subtítulo descritivo. Corpo da notícia completo..."
}- `date` (
timestamp[ns]): Data de publicação padronizada (YYYY-MM-DD). - `labels` (
int64):0para notícias verdadeiras e1para falsas. - `text` (
string): Concatenação deTítulo,SubtítuloeNotíciado corpus original FakeRecogna 2.0.
🚀 Como Usar
Com HuggingFace Datasets
from datasets import load_dataset
# Carregar ambos os splits (train e test)
dataset = load_dataset("HenriqueLz/fakerecogna2-extrativa-elections")
print(dataset)
# DatasetDict({
# train: Dataset({ features: ['date', 'labels', 'text'], num_rows: 42031 }),
# test: Dataset({ features: ['date', 'labels', 'text'], num_rows: 10504 })
# })
# Acessar exemplo
example = dataset["test"][0]
print(example["date"], example["labels"], example["text"][:100])Com Pandas (Ordenação Temporal)
import pandas as pd
from datasets import load_dataset
ds = load_dataset("HenriqueLz/fakerecogna2-extrativa-elections")
df_test = ds["test"].to_pandas()
# Ordenar cronologicamente para avaliação de stream learning
df_test["date"] = pd.to_datetime(df_test["date"])
df_test = df_test.sort_values(by="date").reset_index(drop=True)🔬 Pesquisa e Aplicações
Este dataset foi preparado e utilizado em pesquisas comparando:
- Modelos Tradicionais vs. Aprendizado Online: BoW/TF-IDF com SGDClassifier, Naive Bayes e Passive-Aggressive em regime incremental (delayed, immediate, uncertainty).
- Transformers Pré-treinados em PT-BR: Fine-tuning de modelos como NorBERTo-base, BERTimbau, Albertina, DeBERTinha e XLM-RoBERTa.
📖 Citação
Caso utilize este dataset, cite o trabalho original do FakeRecogna 2.0 apresentado no PROPOR 2024:
@inproceedings{garcia-etal-2024-text,
title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
author = "Garcia, Gabriel Lino and
Paiola, Pedro Henrique and
Jodas, Danilo Samuel and
Sugi, Luis Afonso and
Papa, Jo{\~a}o Paulo",
editor = "Gamallo, Pablo and
Claro, Daniela and
Teixeira, Ant{'o}nio and
Real, Livy and
Garcia, Marcos and
Oliveira, Hugo Gon{\c{c}}alo and
Amaro, Raquel",
booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
month = mar,
year = "2024",
address = "Santiago de Compostela, Galicia/Spain",
publisher = "Association for Computational Lingustics",
url = "https://aclanthology.org/2024.propor-1.9/",
pages = "86--96"
}