CarlosEsquivelSinfonte/vit-waste-segregation
ViT afinado para clasificación de residuos sólidos
Modelo Vision Transformer (ViT) afinado para clasificar imágenes de residuos sólidos en 9 categorías, desarrollado como parte del Quiz 02 del curso Aprendizaje Automático del Programa de Ciencia de Datos, Instituto Tecnológico de Costa Rica (ITCR).
Clases
El modelo clasifica imágenes en 9 categorías de residuos sólidos provenientes del dataset WasteWise: Know Your Waste.
Metodología
Se partió del modelo preentrenado google/vit-base-patch16-224-in21k, el cual fue preentrenado en ImageNet-21k con 14 millones de imágenes y 21,000 clases. Se reemplazó la cabeza de clasificación original por una nueva adaptada a las 9 clases del dataset.
Preparación de datos:
- Fuente: WasteWise: Know Your Waste (Kaggle)
- División estratificada: 70% entrenamiento, 15% validación, 15% pruebas
- Preprocesamiento: redimensionamiento a 224×224 px y normalización con media y desviación estándar de ImageNet
Hiperparámetros:
- Tasa de aprendizaje: 2e-4
- Tamaño de lote: 16
- Épocas máximas: 10
- Weight decay: 0.01
- Warmup steps: 100
- Criterio de parada: Early stopping con patience=3
Infraestructura: Google Colab con GPU T4
Resultados de entrenamiento
El entrenamiento se detuvo en la época 7 por early stopping. El mejor modelo corresponde a la época 4 con accuracy de validación de 87.5%.
