CoolFace
Modelpublic

mostafahagali/image-captioning-vit-transformer

sourceHugging Facemitupdated 7mo agoView on Hugging Face
0likes
Model Card

Image Captioning with Vision Transformers

This repository contains a transformer-based image captioning model trained on the MS COCO dataset.

๐Ÿš€ Demo

Try the live demo here: https://huggingface.co/spaces/mostafahagali/vit-image-captioning

๐Ÿง  Architecture

  • โ€”Vision Transformer (ViT-B/16) encoder
  • โ€”Transformer encoder
  • โ€”Transformer decoder

๐Ÿ“Š Training

  • โ€”Dataset: MS COCO 2017
  • โ€”Loss: Cross-Entropy
  • โ€”Optimizer: AdamW
  • โ€”Framework: PyTorch

๐Ÿ“ฆ Files

  • โ€”best_model.pth: Trained model weights
  • โ€”vocab.pkl: Vocabulary mapping

๐Ÿ› ๏ธ Usage

python
import torch
import pickle
from image_captioning_model import ImageCaptioningModel

with open("vocab.pkl", "rb") as f:
    vocab = pickle.load(f)

model = ImageCaptioningModel(
    vocab_size=len(vocab),
    pad_id=vocab.word2idx["<pad>"],
    use_vit=True
)

state_dict = torch.load("best_model.pth", map_location="cpu")
model.load_state_dict(state_dict)
model.eval()

---
license: mit
---

---
Author: Mostafa Hagali
---