polodealvarado/distilbert-review_classification
013
distilbert-review_classification
Este modelo es una variante de DistilBERT entrenada para la clasificación de reseñas de Amazon en español. Está basado en distilbert-base-multilingual y ha sido afinado para predecir calificaciones de estrellas (1-5) a partir del texto de la reseña.
Modelo
Arquitectura base: DistilBERT (distilbert-base-multilingual) Tarea: Clasificación de texto (5 clases) Idioma: Español Caso de uso: Análisis de sentimiento y clasificación de reseñas
Rendimiento
El modelo fue evaluado en un conjunto de datos balanceado con 1000 muestras para cada clase (calificación de 1 a 5 estrellas):
Rendimiento por clase
Detalles de entrenamiento
- Epochs: 1
- Pasos de entrenamiento: 50,000
- Tiempo de entrenamiento: ~8.2 horas (29,486 segundos)
- Loss final: 0.9721
Uso
from transformers import pipeline
# Crear el pipeline de clasificación
clasificador = pipeline(
"text-classification",
model="polodealvarado/distilbert-review_classification",
tokenizer="polodealvarado/distilbert-review_classification",
top_k=1, # Solo la clase más probable
)
# Texto de entrada
texto = "Este producto superó mis expectativas, lo recomiendo totalmente."
# Realizar predicción
output = clasificador(texto)
# Extraer la clase predicha (por ejemplo, 'LABEL_0', 'LABEL_1', ...)
etiqueta = output[0][0]["label"]
indice = int(etiqueta.replace("LABEL_", "")) # 'LABEL_0' → 0
estrellas_predichas = indice + 1
print(f"Predicción: {estrellas_predichas} estrellas")Limitaciones
- El modelo fue entrenado con datos de reseñas de Amazon, por lo que puede tener un rendimiento reducido en otros dominios.
- El rendimiento es más alto para reseñas claramente positivas (5 estrellas) o claramente negativas (1 estrella), mientras que las clasificaciones intermedias (2-4 estrellas) muestran un rendimiento más modesto.
