caeher/xlm-roberta-base-b2-sv
XLM-R base B2 — baseline de clasificación tóxica
Baseline multiclase para cuatro categorías:
- No Tóxico
- Lenguaje Ofensivo
- Discurso de Odio
- Amenazas/Violencia
Está basado en xlm-roberta-base y fue ajustado con el conjunto B2 del proyecto, usando texto_modelo, longitud máxima 128, cuatro épocas, tasa de aprendizaje 2e-5 y semilla 42. Su objetivo es servir como control frente a los modelos preentrenados específicamente sobre lenguaje de redes sociales.
Resultados de esta corrida
IC bootstrap 95% del F1 de test: [0.7558, 0.8304]. Batería adversarial: 110/144. Sonda dirigida: 165/204.
Estas cifras corresponden a la corrida publicada y pueden diferir de otros experimentos del proyecto por versión de PyTorch, precisión mixta y hardware. El modelo es un baseline de comparación, no el modelo recomendado para uso operativo.
Uso
from transformers import pipeline
clf = pipeline("text-classification", model="caeher/xlm-roberta-base-b2-sv")
clf("texto de una publicación")Este modelo no debe usarse como único criterio para moderación ni para tomar decisiones sobre personas; requiere revisión humana y evaluación específica del dominio.
