CoolFace
Modelpublic

HenriqueLz/norberto-base-fakerecogna2-extrativa-elections

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes8downloads
Model Card

NorBERTo Base - FakeRecogna 2.0 Extrativa (Elections Split)

Este modelo é uma versão fine-tuned do `Itau-Unibanco/NorBERTo-base` para a tarefa de Detecção de Notícias Falsas (Fake News) em português brasileiro, treinado no dataset `HenriqueLz/fakerecogna2-extrativa-elections`.

Desempenho no Teste

  • —F1-Score Geral (Ponderado): `0.998`
  • —Conjunto de Avaliação: 10.504 notícias posteriores a 30/10/2021 (cenário eleitoral brasileiro de 2022).

Rótulos das Classes

IDLabelDescrição
0VERDADEIRANotícia factual / verdadeira
1FALSANotícia falsa / desinformação

Como usar

1. Inferência com pipeline:

python
from transformers import pipeline

classifier = pipeline(
    "text-classification",
    model="HenriqueLz/norberto-base-fakerecogna2-extrativa-elections",
    tokenizer="HenriqueLz/norberto-base-fakerecogna2-extrativa-elections",
)

texto = "Ministério da Saúde divulga calendário oficial de vacinação para o próximo ano."
resultado = classifier(texto)
print(resultado)
# Output: [{'label': 'VERDADEIRA', 'score': 0.99...}]

2. Carregamento Manual com PyTorch:

python
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification

tokenizer = AutoTokenizer.from_pretrained("HenriqueLz/norberto-base-fakerecogna2-extrativa-elections")
model = AutoModelForSequenceClassification.from_pretrained("HenriqueLz/norberto-base-fakerecogna2-extrativa-elections")

texto = "Texto da notícia para classificação..."
inputs = tokenizer(texto, return_tensors="pt", truncation=True, max_length=512)

with torch.no_grad():
    logits = model(**inputs).logits

predicted_class_id = logits.argmax().item()
label = model.config.id2label[predicted_class_id]
print(f"Classe predita: {label}")

Detalhes do Treinamento

  • —Dataset: `HenriqueLz/fakerecogna2-extrativa-elections` (split temporal com data de corte em 30/10/2021).
  • —Hardware: Treinado em ambiente de nuvem no Kaggle em GPU NVIDIA Tesla P100 (16 GB VRAM).
  • —Épocas: 5 épocas completas.
  • —Taxa de Aprendizado (Learning Rate): 1e-5 com otimizador AdamW e decaimento de peso (weight decay) de 0.01.
  • —Precisão: FP16 (Mixed Precision).
  • —Batch Size: 16 (com DataCollatorWithPadding).

Limitações

  • —O modelo foi treinado em textos jornalísticos em português brasileiro e pode ter desempenho inferior em textos curtos de redes sociais, gírias regionais excessivas ou outros idiomas.
  • —Como classificador probabilístico, deve ser utilizado como ferramenta de apoio à checagem e moderação, e não como fonte única e infalível de veracidade.

Citações

Caso utilize este modelo em sua pesquisa, cite o dataset base FakeRecogna 2.0 e o artigo original da arquitetura correspondente:

FakeRecogna 2.0 (PROPOR 2024):

bibtex
@inproceedings{garcia-etal-2024-text,
  title     = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
  author    = "Garcia, Gabriel Lino and Paiola, Pedro Henrique and Jodas, Danilo Samuel and Sugi, Luis Afonso and Papa, Jo{\~a}o Paulo",
  booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
  month     = mar,
  year      = "2024",
  address   = "Santiago de Compostela, Galicia/Spain",
  publisher = "Association for Computational Lingustics",
  url       = "https://aclanthology.org/2024.propor-1.9/",
  pages     = "86--96"
}

Arquitetura Base (NorBERTo Base):

bibtex
@inproceedings{silva-etal-2026-norberto,
    title = "{N}or{BERT}o: A {M}odern{BERT} Model Trained for {P}ortuguese with 331 Billion Tokens Corpus",
    author = "Silva, Enzo S. N.  and
      Costa, Pablo B.  and
      Vlasman, Raphael C.  and
      Costa, Rosimeire P.  and
      Silva, Henrique L. P.  and
      Pellicer, Lucas F. A. O.  and
      Rinaldo, Guilherme  and
      Almeida, Renato A.  and
      Rabbani, Darian S. R.  and
      Oestreich, Cinthya O.  and
      Carid{'a}, Vinicius F.",
    editor = "Souza, Marlo  and
      de-Dios-Flores, Iria  and
      Santos, Diana  and
      Freitas, Larissa  and
      Souza, Jackson Wilke da Cruz  and
      Ribeiro, Eug{'e}nio",
    booktitle = "Proceedings of the 17th International Conference on Computational Processing of {P}ortuguese ({PROPOR} 2026) - Vol. 1",
    month = apr,
    year = "2026",
    address = "Salvador, Brazil",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2026.propor-1.18/",
    pages = "183--193",
    ISBN = "979-8-89176-387-6"
}