YiMeng-SYSU/vit-base-patch16-224-in21k-finetuned-cifar100
01
Vision Transformer (ViT) Base Model Fine-tuned on CIFAR-100
This model is a fine-tuned version of `vit_base_patch16_224` on the CIFAR-100 dataset. It achieves an accuracy of 83.58% on the validation set.
Model Details
- Architecture: Vision Transformer (ViT)
- Base Model: ImageNet-21k pre-trained
- Framework: PyTorch + Timm
- Hardware: Trained on NVIDIA RTX 5070 Ti + AMD 9800X3D
Performance
Usage (Inference)
Here is how to use this model to classify an image:
import timm
import torch
from PIL import Image
from urllib.request import urlopen
# 1. Load Model
model = timm.create_model("hf_hub:YiMeng-SYSU/vit-base-patch16-224-in21k-finetuned-cifar100", pretrained=True)
model.eval()
# 2. Prepare Image
url = 'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/cifar100-test.jpg'
img = Image.open(urlopen(url))
# 3. Predict
data_config = timm.data.resolve_model_data_config(model)
transforms = timm.data.create_transform(**data_config, is_training=False)
output = model(transforms(img).unsqueeze(0))
print(f"Predicted Class ID: {output.argmax().item()}")