HenriqueLz/norberto-base-fakerecogna2-extrativa-elections
08
NorBERTo Base - FakeRecogna 2.0 Extrativa (Elections Split)
Este modelo é uma versão fine-tuned do `Itau-Unibanco/NorBERTo-base` para a tarefa de Detecção de Notícias Falsas (Fake News) em português brasileiro, treinado no dataset `HenriqueLz/fakerecogna2-extrativa-elections`.
Desempenho no Teste
- F1-Score Geral (Ponderado): `0.998`
- Conjunto de Avaliação: 10.504 notícias posteriores a 30/10/2021 (cenário eleitoral brasileiro de 2022).
Rótulos das Classes
Como usar
1. Inferência com pipeline:
from transformers import pipeline
classifier = pipeline(
"text-classification",
model="HenriqueLz/norberto-base-fakerecogna2-extrativa-elections",
tokenizer="HenriqueLz/norberto-base-fakerecogna2-extrativa-elections",
)
texto = "Ministério da Saúde divulga calendário oficial de vacinação para o próximo ano."
resultado = classifier(texto)
print(resultado)
# Output: [{'label': 'VERDADEIRA', 'score': 0.99...}]2. Carregamento Manual com PyTorch:
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("HenriqueLz/norberto-base-fakerecogna2-extrativa-elections")
model = AutoModelForSequenceClassification.from_pretrained("HenriqueLz/norberto-base-fakerecogna2-extrativa-elections")
texto = "Texto da notícia para classificação..."
inputs = tokenizer(texto, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
logits = model(**inputs).logits
predicted_class_id = logits.argmax().item()
label = model.config.id2label[predicted_class_id]
print(f"Classe predita: {label}")Detalhes do Treinamento
- Dataset: `HenriqueLz/fakerecogna2-extrativa-elections` (split temporal com data de corte em 30/10/2021).
- Hardware: Treinado em ambiente de nuvem no Kaggle em GPU NVIDIA Tesla P100 (16 GB VRAM).
- Épocas: 5 épocas completas.
- Taxa de Aprendizado (Learning Rate):
1e-5com otimizador AdamW e decaimento de peso (weight decay) de0.01. - Precisão: FP16 (Mixed Precision).
- Batch Size: 16 (com
DataCollatorWithPadding).
Limitações
- O modelo foi treinado em textos jornalísticos em português brasileiro e pode ter desempenho inferior em textos curtos de redes sociais, gírias regionais excessivas ou outros idiomas.
- Como classificador probabilístico, deve ser utilizado como ferramenta de apoio à checagem e moderação, e não como fonte única e infalível de veracidade.
Citações
Caso utilize este modelo em sua pesquisa, cite o dataset base FakeRecogna 2.0 e o artigo original da arquitetura correspondente:
FakeRecogna 2.0 (PROPOR 2024):
@inproceedings{garcia-etal-2024-text,
title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
author = "Garcia, Gabriel Lino and Paiola, Pedro Henrique and Jodas, Danilo Samuel and Sugi, Luis Afonso and Papa, Jo{\~a}o Paulo",
booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
month = mar,
year = "2024",
address = "Santiago de Compostela, Galicia/Spain",
publisher = "Association for Computational Lingustics",
url = "https://aclanthology.org/2024.propor-1.9/",
pages = "86--96"
}Arquitetura Base (NorBERTo Base):
@inproceedings{silva-etal-2026-norberto,
title = "{N}or{BERT}o: A {M}odern{BERT} Model Trained for {P}ortuguese with 331 Billion Tokens Corpus",
author = "Silva, Enzo S. N. and
Costa, Pablo B. and
Vlasman, Raphael C. and
Costa, Rosimeire P. and
Silva, Henrique L. P. and
Pellicer, Lucas F. A. O. and
Rinaldo, Guilherme and
Almeida, Renato A. and
Rabbani, Darian S. R. and
Oestreich, Cinthya O. and
Carid{'a}, Vinicius F.",
editor = "Souza, Marlo and
de-Dios-Flores, Iria and
Santos, Diana and
Freitas, Larissa and
Souza, Jackson Wilke da Cruz and
Ribeiro, Eug{'e}nio",
booktitle = "Proceedings of the 17th International Conference on Computational Processing of {P}ortuguese ({PROPOR} 2026) - Vol. 1",
month = apr,
year = "2026",
address = "Salvador, Brazil",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2026.propor-1.18/",
pages = "183--193",
ISBN = "979-8-89176-387-6"
}