CoolFace
Modelpublic

YiMeng-SYSU/vit-base-patch16-224-in21k-finetuned-cifar100

sourceHugging Faceapache-2.0updated 9mo agoView on Hugging Face
0likes1downloads
Model Card

Vision Transformer (ViT) Base Model Fine-tuned on CIFAR-100

This model is a fine-tuned version of `vit_base_patch16_224` on the CIFAR-100 dataset. It achieves an accuracy of 83.58% on the validation set.

Model Details

  • —Architecture: Vision Transformer (ViT)
  • —Base Model: ImageNet-21k pre-trained
  • —Framework: PyTorch + Timm
  • —Hardware: Trained on NVIDIA RTX 5070 Ti + AMD 9800X3D

Performance

MetricValue
Accuracy0.8358
Epochs20
Batch Size128

Usage (Inference)

Here is how to use this model to classify an image:

python
import timm
import torch
from PIL import Image
from urllib.request import urlopen

# 1. Load Model
model = timm.create_model("hf_hub:YiMeng-SYSU/vit-base-patch16-224-in21k-finetuned-cifar100", pretrained=True)
model.eval()

# 2. Prepare Image
url = 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/cifar100-test.jpg'
img = Image.open(urlopen(url))

# 3. Predict
data_config = timm.data.resolve_model_data_config(model)
transforms = timm.data.create_transform(**data_config, is_training=False)

output = model(transforms(img).unsqueeze(0))
print(f"Predicted Class ID: {output.argmax().item()}")