CoolFace
Modelpublic

CarlosEsquivelSinfonte/vit-waste-segregation

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes23downloads
Model Card

ViT afinado para clasificación de residuos sólidos

Modelo Vision Transformer (ViT) afinado para clasificar imágenes de residuos sólidos en 9 categorías, desarrollado como parte del Quiz 02 del curso Aprendizaje Automático del Programa de Ciencia de Datos, Instituto Tecnológico de Costa Rica (ITCR).

Clases

El modelo clasifica imágenes en 9 categorías de residuos sólidos provenientes del dataset WasteWise: Know Your Waste.

Metodología

Se partió del modelo preentrenado google/vit-base-patch16-224-in21k, el cual fue preentrenado en ImageNet-21k con 14 millones de imágenes y 21,000 clases. Se reemplazó la cabeza de clasificación original por una nueva adaptada a las 9 clases del dataset.

Preparación de datos:

  • —Fuente: WasteWise: Know Your Waste (Kaggle)
  • —División estratificada: 70% entrenamiento, 15% validación, 15% pruebas
  • —Preprocesamiento: redimensionamiento a 224×224 px y normalización con media y desviación estándar de ImageNet

Hiperparámetros:

  • —Tasa de aprendizaje: 2e-4
  • —Tamaño de lote: 16
  • —Épocas máximas: 10
  • —Weight decay: 0.01
  • —Warmup steps: 100
  • —Criterio de parada: Early stopping con patience=3

Infraestructura: Google Colab con GPU T4

Resultados de entrenamiento

ÉpocaTraining LossValidation LossAccuracy
11.9534281.5289710.5625
21.0001550.8779940.7292
30.4134630.6302040.7917
40.1775670.5093010.8750
50.0762500.6204980.8125
60.0456160.5830180.8333
70.0343950.5743070.8264

El entrenamiento se detuvo en la época 7 por early stopping. El mejor modelo corresponde a la época 4 con accuracy de validación de 87.5%.