CoolFace
Modelpublic

oneryalcin/rvl-cdip-setfit-neomme

sourceHugging Faceupdated 16d agoView on Hugging Face
0likes28downloads
Model Card

SetFit with Hcompany/NeoMME-260M-Retriever-ST-dense

This is a SetFit model that can be used for Text Classification. This SetFit model uses Hcompany/NeoMME-260M-Retriever-ST-dense as the Sentence Transformer embedding model. A LogisticRegression instance is used for classification.

The model has been trained using an efficient few-shot learning technique that involves:

  1. 1.Fine-tuning a Sentence Transformer with contrastive learning.
  2. 2.Training a classification head with features from the fine-tuned Sentence Transformer.

Model Details

Model Description

Model Sources

Model Labels

LabelExamples
questionnaire<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185FA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184E90></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=613x800 at 0x7F042C184E90></li></ul>
invoice<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C1861E0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=622x800 at 0x7F042C186AB0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184710></li></ul>
advertisement<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184E90></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=617x800 at 0x7F042C184710></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184E90></li></ul>
scientific publication<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C186030></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=632x800 at 0x7F042C184E90></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185DF0></li></ul>
letter<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=618x800 at 0x7F042C185DF0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185DC0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=628x800 at 0x7F042C1861E0></li></ul>
file folder<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C186BA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=610x800 at 0x7F042C184E90></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185DF0></li></ul>
form<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185DC0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=642x800 at 0x7F042C184710></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=622x800 at 0x7F042C186720></li></ul>
email<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185FA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C1861E0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C186BA0></li></ul>
budget<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=622x800 at 0x7F042C186AB0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=662x800 at 0x7F042C184710></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=621x800 at 0x7F042C186720></li></ul>
specification<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=629x800 at 0x7F042C185FA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=627x800 at 0x7F042C186030></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=722x800 at 0x7F042C186AB0></li></ul>
news article<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=579x800 at 0x7F042C184710></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185DC0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=628x800 at 0x7F042C186BA0></li></ul>
scientific report<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=615x800 at 0x7F042C186030></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=622x800 at 0x7F042C184710></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=622x800 at 0x7F042C184E90></li></ul>
handwritten<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185FA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C186BA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=617x800 at 0x7F042C185DF0></li></ul>
resume<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C186030></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184710></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C185DC0></li></ul>
presentation<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=622x800 at 0x7F042C1861E0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C186BA0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184E90></li></ul>
memo<ul><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=610x800 at 0x7F042C185DC0></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=603x800 at 0x7F042C184E90></li><li><PIL.PngImagePlugin.PngImageFile image mode=RGB size=610x800 at 0x7F042C184710></li></ul>

Uses

Direct Use for Inference

First install the SetFit library:

bash
pip install setfit

Then you can load this model and run inference.

python
from PIL import Image

from setfit import SetFitModel

# Download from the 🤗 Hub
model = SetFitModel.from_pretrained("oneryalcin/rvl-cdip-setfit-neomme")
# Run inference on images
preds = model([Image.open("example.png")])

<!--

Downstream Use

List how someone could finetune this model on their own dataset. -->

<!--

Out-of-Scope Use

List how the model may foreseeably be misused and address what users ought not to do with the model. -->

<!--

Bias, Risks and Limitations

What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->

<!--

Recommendations

What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->

Training Details

Training Hyperparameters

  • —batch_size: (4, 4)
  • —num_epochs: (1, 1)
  • —max_steps: -1
  • —sampling_strategy: oversampling
  • —num_iterations: 5
  • —bodylearningrate: (2e-05, 1e-05)
  • —headlearningrate: 0.01
  • —loss: CosineSimilarityLoss
  • —distancemetric: cosinedistance
  • —margin: 0.25
  • —endtoend: False
  • —use_amp: False
  • —warmup_proportion: 0.1
  • —l2_weight: 0.01
  • —seed: 42
  • —evalmaxsteps: -1
  • —loadbestmodelatend: False

Training Results

EpochStepTraining LossValidation Loss
0.003110.1619-
0.1562500.2096-
0.31251000.1618-
0.46881500.1933-
0.6252000.1195-
0.78122500.1068-
0.93753000.0836-

Framework Versions

  • —Python: 3.12.12
  • —SetFit: 1.3.0.dev0
  • —Sentence Transformers: 6.0.1
  • —Transformers: 5.17.0
  • —PyTorch: 2.14.0+cu130
  • —Datasets: 5.0.1
  • —Tokenizers: 0.23.2

Citation

BibTeX

bibtex
@article{https://doi.org/10.48550/arxiv.2209.11055,
    doi = {10.48550/ARXIV.2209.11055},
    url = {https://arxiv.org/abs/2209.11055},
    author = {Tunstall, Lewis and Reimers, Nils and Jo, Unso Eun Seo and Bates, Luke and Korat, Daniel and Wasserblat, Moshe and Pereg, Oren},
    keywords = {Computation and Language (cs.CL), FOS: Computer and information sciences, FOS: Computer and information sciences},
    title = {Efficient Few-Shot Learning Without Prompts},
    publisher = {arXiv},
    year = {2022},
    copyright = {Creative Commons Attribution 4.0 International}
}

<!--

Glossary

Clearly define terms in order to be accessible across audiences. -->

<!--

Model Card Authors

Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->

<!--

Model Card Contact

Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->

Evaluation (jordyvl/rvlcdip100examplesper_class, split test)

accuracy 0.532, macro F1 0.516 on 400 images; 8 training images per class; body Hcompany/NeoMME-260M-Retriever-ST-dense, task document; trained in 769s on cuda.

                        precision    recall  f1-score   support

         advertisement       0.56      0.76      0.64        25
                budget       0.41      0.28      0.33        25
                 email       0.64      0.56      0.60        25
           file folder       0.54      0.76      0.63        25
                  form       0.41      0.48      0.44        25
           handwritten       0.83      0.76      0.79        25
               invoice       0.33      0.24      0.28        25
                letter       0.58      0.60      0.59        25
                  memo       0.30      0.32      0.31        25
          news article       0.50      0.64      0.56        25
          presentation       0.33      0.24      0.28        25
         questionnaire       0.38      0.36      0.37        25
                resume       1.00      0.92      0.96        25
scientific publication       0.61      0.76      0.68        25
     scientific report       0.43      0.12      0.19        25
         specification       0.53      0.72      0.61        25

              accuracy                           0.53       400
             macro avg       0.52      0.53      0.52       400
          weighted avg       0.52      0.53      0.52       400