Anderson230101/beto-fakenews-tuned
013
BETO Fine-tuned para Detección de Fake News en Español
Modelo BERT en español (BETO) afinado para clasificar noticias en español como real (0) o fake (1).
Detalles
- Modelo base:
dccuchile/bert-base-spanish-wwm-cased - Corpus: Spanish Fake News Corpus (Posadas-Durán et al.)
- Tarea: clasificación binaria (
real/fake) - Idioma: español (multi-país: México, España, Latinoamérica)
- max_length: 512 tokens (WordPiece)
Resultados
Multi-seed: 13, 42, 87, 123, 2024. El F1 reportado es la media. El sweep de hiperparámetros usó learningrate, batchsize, warmupratio y weightdecay sobre validation set, evaluando solo en test (sin leakage).
Uso
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
tokenizer = AutoTokenizer.from_pretrained("Anderson230101/beto-fakenews-tuned")
model = AutoModelForSequenceClassification.from_pretrained("Anderson230101/beto-fakenews-tuned")
text = "El presidente anuncia un nuevo programa social para zonas rurales."
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
logits = model(**inputs).logits
probs = torch.softmax(logits, dim=-1)[0]
labels = ["real", "fake"]
print({labels[i]: float(probs[i]) for i in range(2)})Limitaciones
- Entrenado solo en corpus Posadas-Durán; no se valida out-of-domain.
- Sesgado hacia el estilo del corpus (sátira política, bulos virales pre-2020). Textos modernos o de otros temas pueden bajar la performance.
- F1=0.7585 < 0.80 (objetivo académico) — probablemente techo del corpus por errores de etiquetado y ambigüedad real/sátira.
Cita
Proyecto académico para el curso de IA — UTP (Universidad Tecnológica del Perú), 2026.
Corpus: Posadas-Durán, J. P., Gómez-Adorno, H., Sidorov, G., & Escobar, J. J. M. (2019). Detection of fake news in a new corpus for the Spanish language. Journal of Intelligent & Fuzzy Systems.
