CoolFace
Modelpublic

HAMMALE/vit-tiny-classifier-rvlcdip

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes152downloads
README.md132 linesDownload Raw Back to root
1---2language: en3license: apache-2.04tags:5- vision6- image-classification7- document-classification8- knowledge-distillation9- vit10- rvl-cdip11- tiny-model12- distilled-model13datasets:14- rvl_cdip15metrics:16- accuracy17pipeline_tag: image-classification18 19---20 21# ViT-Tiny Classifier for RVL-CDIP Document Classification (Distilled)22 23This model is a compressed Vision Transformer (ViT-Tiny) trained using knowledge distillation from DiT-Large on the RVL-CDIP dataset for document image classification.24This model was developed as part of a **research internship at the Laboratory of Complex Systems, Ecole Centrale Casablanca**25## Model Details26 27- **Student Model**: ViT-Tiny (Vision Transformer)28- **Teacher Model**: microsoft/dit-large-finetuned-rvlcdip29- **Training Method**: Knowledge Distillation30- **Parameters**: ~5.5M (55x smaller than teacher)31- **Dataset**: RVL-CDIP (320k document images, 16 classes)32- **Task**: Document Image Classification33- **Accuracy**: 0.921034- **Compression Ratio**: ~55x parameter reduction from teacher model35 36## Document Classes37 38The model classifies documents into 16 categories:39 401. **letter** - Personal or business correspondence412. **form** - Structured forms and applications423. **email** - Email communications434. **handwritten** - Handwritten documents445. **advertisement** - Marketing materials and ads456. **scientific_report** - Research reports and studies467. **scientific_publication** - Academic papers and journals478. **specification** - Technical specifications489. **file_folder** - File folders and organizational documents4910. **news_article** - News articles and press releases5011. **budget** - Financial budgets and planning documents5112. **invoice** - Bills and invoices5213. **presentation** - Presentation slides5314. **questionnaire** - Surveys and questionnaires5415. **resume** - CVs and resumes5516. **memo** - Internal memos and notices56 57## Usage58 59```python60from transformers import AutoImageProcessor, AutoModelForImageClassification61from PIL import Image62 63# Load model64processor = AutoImageProcessor.from_pretrained("HAMMALE/vit-tiny-classifier-rvlcdip")65model = AutoModelForImageClassification.from_pretrained("HAMMALE/vit-tiny-classifier-rvlcdip")66 67# Load and classify an image68image = Image.open("path_to_your_document_image.jpg")69inputs = processor(image, return_tensors="pt")70 71# Get predictions72outputs = model(**inputs)73predicted_class_id = outputs.logits.argmax(-1).item()74 75# Get class names76class_names = [77    "letter", "form", "email", "handwritten", "advertisement", 78    "scientific_report", "scientific_publication", "specification", 79    "file_folder", "news_article", "budget", "invoice", 80    "presentation", "questionnaire", "resume", "memo"81]82 83predicted_class = class_names[predicted_class_id]84print("Predicted class:", predicted_class)85```86 87## Performance88 89| Metric | Value |90|--------|-------|91| Accuracy | 0.9210 |92| Parameters | ~5.5M |93| Model Size | ~22 MB |94| Input Size | 224x224 pixels |95 96## Training Details97 98- **Student Architecture**: Vision Transformer (ViT-Tiny) 99- **Teacher Model**: microsoft/dit-large-finetuned-rvlcdip100- **Distillation Method**: Knowledge Distillation101- **Input Resolution**: 224x224102- **Preprocessing**: Standard ImageNet normalization103- **Framework**: Transformers/PyTorch104- **Distillation Benefits**: Maintains high accuracy with 55x fewer parameters105 106## Dataset107 108The RVL-CDIP (Ryerson Vision Lab Complex Document Information Processing) dataset contains:109- 400,000 grayscale document images110- 16 document categories111- Images collected from truth tobacco industry documents112- Standard train/validation/test splits113 114## Citation115 116```bibtex117@misc{hammale2025vit_tiny_rvlcdip_distilled,118  title={ViT-Tiny Classifier for RVL-CDIP Document Classification (Distilled)},119  author={Hammale, Mourad},120  year={2025},121  howpublished={\url{https://huggingface.co/HAMMALE/vit-tiny-classifier-rvlcdip}},122  note={Knowledge distilled from microsoft/dit-large-finetuned-rvlcdip}123}124```125 126## Acknowledgments127 128This model was created by HAMMALE (Mourad) through knowledge distillation from the larger DiT-Large model (microsoft/dit-large-finetuned-rvlcdip), achieving significant compression while maintaining competitive performance for document classification tasks.129 130## License131 132This model is released under the Apache 2.0 license.