CoolFace
Modelpublic

Anderson230101/beto-fakenews-tuned

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes13downloads
Model Card

BETO Fine-tuned para Detección de Fake News en Español

Modelo BERT en español (BETO) afinado para clasificar noticias en español como real (0) o fake (1).

Detalles

  • —Modelo base: dccuchile/bert-base-spanish-wwm-cased
  • —Corpus: Spanish Fake News Corpus (Posadas-Durán et al.)
  • —Tarea: clasificación binaria (real / fake)
  • —Idioma: español (multi-país: México, España, Latinoamérica)
  • —max_length: 512 tokens (WordPiece)

Resultados

MétricaValor
F1 (best seed=123)0.7585
F1 (multi-seed avg, 5 seeds)0.7452 ± 0.0116
Accuracy0.7762
Precision (fake)0.7544
Recall (fake)0.7625

Multi-seed: 13, 42, 87, 123, 2024. El F1 reportado es la media. El sweep de hiperparámetros usó learningrate, batchsize, warmupratio y weightdecay sobre validation set, evaluando solo en test (sin leakage).

Uso

python
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("Anderson230101/beto-fakenews-tuned")
model = AutoModelForSequenceClassification.from_pretrained("Anderson230101/beto-fakenews-tuned")

text = "El presidente anuncia un nuevo programa social para zonas rurales."
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
    logits = model(**inputs).logits
probs = torch.softmax(logits, dim=-1)[0]
labels = ["real", "fake"]
print({labels[i]: float(probs[i]) for i in range(2)})

Limitaciones

  • —Entrenado solo en corpus Posadas-Durán; no se valida out-of-domain.
  • —Sesgado hacia el estilo del corpus (sátira política, bulos virales pre-2020). Textos modernos o de otros temas pueden bajar la performance.
  • —F1=0.7585 < 0.80 (objetivo académico) — probablemente techo del corpus por errores de etiquetado y ambigüedad real/sátira.

Cita

Proyecto académico para el curso de IA — UTP (Universidad Tecnológica del Perú), 2026.

Corpus: Posadas-Durán, J. P., Gómez-Adorno, H., Sidorov, G., & Escobar, J. J. M. (2019). Detection of fake news in a new corpus for the Spanish language. Journal of Intelligent & Fuzzy Systems.