CoolFace
Apppublic

Aluode/PerceptionLabPortable

sourceHugging Faceupdated 9mo agoView on Hugging Face
0likes
modeling_auto.py2383 linesDownload Raw Back to auto
1# coding=utf-82# Copyright 2018 The HuggingFace Inc. team.3#4# Licensed under the Apache License, Version 2.0 (the "License");5# you may not use this file except in compliance with the License.6# You may obtain a copy of the License at7#8#     http://www.apache.org/licenses/LICENSE-2.09#10# Unless required by applicable law or agreed to in writing, software11# distributed under the License is distributed on an "AS IS" BASIS,12# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.13# See the License for the specific language governing permissions and14# limitations under the License.15"""Auto Model class."""16 17import os18import warnings19from collections import OrderedDict20from typing import TYPE_CHECKING, Union21 22from ...utils import logging23from .auto_factory import (24    _BaseAutoBackboneClass,25    _BaseAutoModelClass,26    _LazyAutoMapping,27    auto_class_update,28)29from .configuration_auto import CONFIG_MAPPING_NAMES30 31 32if TYPE_CHECKING:33    from ...generation import GenerationMixin34    from ...modeling_utils import PreTrainedModel35 36    # class for better type annotations37    class _BaseModelWithGenerate(PreTrainedModel, GenerationMixin):38        pass39 40 41logger = logging.get_logger(__name__)42 43MODEL_MAPPING_NAMES = OrderedDict(44    [45        # Base model mapping46        ("aimv2", "Aimv2Model"),47        ("aimv2_vision_model", "Aimv2VisionModel"),48        ("albert", "AlbertModel"),49        ("align", "AlignModel"),50        ("altclip", "AltCLIPModel"),51        ("apertus", "ApertusModel"),52        ("arcee", "ArceeModel"),53        ("aria", "AriaModel"),54        ("aria_text", "AriaTextModel"),55        ("audio-spectrogram-transformer", "ASTModel"),56        ("autoformer", "AutoformerModel"),57        ("aya_vision", "AyaVisionModel"),58        ("bamba", "BambaModel"),59        ("bark", "BarkModel"),60        ("bart", "BartModel"),61        ("beit", "BeitModel"),62        ("bert", "BertModel"),63        ("bert-generation", "BertGenerationEncoder"),64        ("big_bird", "BigBirdModel"),65        ("bigbird_pegasus", "BigBirdPegasusModel"),66        ("biogpt", "BioGptModel"),67        ("bit", "BitModel"),68        ("bitnet", "BitNetModel"),69        ("blenderbot", "BlenderbotModel"),70        ("blenderbot-small", "BlenderbotSmallModel"),71        ("blip", "BlipModel"),72        ("blip-2", "Blip2Model"),73        ("blip_2_qformer", "Blip2QFormerModel"),74        ("bloom", "BloomModel"),75        ("blt", "BltModel"),76        ("bridgetower", "BridgeTowerModel"),77        ("bros", "BrosModel"),78        ("camembert", "CamembertModel"),79        ("canine", "CanineModel"),80        ("chameleon", "ChameleonModel"),81        ("chinese_clip", "ChineseCLIPModel"),82        ("chinese_clip_vision_model", "ChineseCLIPVisionModel"),83        ("clap", "ClapModel"),84        ("clip", "CLIPModel"),85        ("clip_text_model", "CLIPTextModel"),86        ("clip_vision_model", "CLIPVisionModel"),87        ("clipseg", "CLIPSegModel"),88        ("clvp", "ClvpModelForConditionalGeneration"),89        ("code_llama", "LlamaModel"),90        ("codegen", "CodeGenModel"),91        ("cohere", "CohereModel"),92        ("cohere2", "Cohere2Model"),93        ("cohere2_vision", "Cohere2VisionModel"),94        ("conditional_detr", "ConditionalDetrModel"),95        ("convbert", "ConvBertModel"),96        ("convnext", "ConvNextModel"),97        ("convnextv2", "ConvNextV2Model"),98        ("cpmant", "CpmAntModel"),99        ("csm", "CsmForConditionalGeneration"),100        ("ctrl", "CTRLModel"),101        ("cvt", "CvtModel"),102        ("d_fine", "DFineModel"),103        ("dab-detr", "DabDetrModel"),104        ("dac", "DacModel"),105        ("data2vec-audio", "Data2VecAudioModel"),106        ("data2vec-text", "Data2VecTextModel"),107        ("data2vec-vision", "Data2VecVisionModel"),108        ("dbrx", "DbrxModel"),109        ("deberta", "DebertaModel"),110        ("deberta-v2", "DebertaV2Model"),111        ("decision_transformer", "DecisionTransformerModel"),112        ("deepseek_v2", "DeepseekV2Model"),113        ("deepseek_v3", "DeepseekV3Model"),114        ("deepseek_vl", "DeepseekVLModel"),115        ("deepseek_vl_hybrid", "DeepseekVLHybridModel"),116        ("deformable_detr", "DeformableDetrModel"),117        ("deit", "DeiTModel"),118        ("depth_pro", "DepthProModel"),119        ("deta", "DetaModel"),120        ("detr", "DetrModel"),121        ("dia", "DiaModel"),122        ("diffllama", "DiffLlamaModel"),123        ("dinat", "DinatModel"),124        ("dinov2", "Dinov2Model"),125        ("dinov2_with_registers", "Dinov2WithRegistersModel"),126        ("dinov3_convnext", "DINOv3ConvNextModel"),127        ("dinov3_vit", "DINOv3ViTModel"),128        ("distilbert", "DistilBertModel"),129        ("doge", "DogeModel"),130        ("donut-swin", "DonutSwinModel"),131        ("dots1", "Dots1Model"),132        ("dpr", "DPRQuestionEncoder"),133        ("dpt", "DPTModel"),134        ("edgetam", "EdgeTamModel"),135        ("edgetam_video", "EdgeTamVideoModel"),136        ("edgetam_vision_model", "EdgeTamVisionModel"),137        ("efficientformer", "EfficientFormerModel"),138        ("efficientloftr", "EfficientLoFTRModel"),139        ("efficientnet", "EfficientNetModel"),140        ("electra", "ElectraModel"),141        ("emu3", "Emu3Model"),142        ("encodec", "EncodecModel"),143        ("ernie", "ErnieModel"),144        ("ernie4_5", "Ernie4_5Model"),145        ("ernie4_5_moe", "Ernie4_5_MoeModel"),146        ("ernie_m", "ErnieMModel"),147        ("esm", "EsmModel"),148        ("evolla", "EvollaModel"),149        ("exaone4", "Exaone4Model"),150        ("falcon", "FalconModel"),151        ("falcon_h1", "FalconH1Model"),152        ("falcon_mamba", "FalconMambaModel"),153        ("fastspeech2_conformer", "FastSpeech2ConformerModel"),154        ("fastspeech2_conformer_with_hifigan", "FastSpeech2ConformerWithHifiGan"),155        ("flaubert", "FlaubertModel"),156        ("flava", "FlavaModel"),157        ("flex_olmo", "FlexOlmoModel"),158        ("florence2", "Florence2Model"),159        ("fnet", "FNetModel"),160        ("focalnet", "FocalNetModel"),161        ("fsmt", "FSMTModel"),162        ("funnel", ("FunnelModel", "FunnelBaseModel")),163        ("fuyu", "FuyuModel"),164        ("gemma", "GemmaModel"),165        ("gemma2", "Gemma2Model"),166        ("gemma3", "Gemma3Model"),167        ("gemma3_text", "Gemma3TextModel"),168        ("gemma3n", "Gemma3nModel"),169        ("gemma3n_audio", "Gemma3nAudioEncoder"),170        ("gemma3n_text", "Gemma3nTextModel"),171        ("gemma3n_vision", "TimmWrapperModel"),172        ("git", "GitModel"),173        ("glm", "GlmModel"),174        ("glm4", "Glm4Model"),175        ("glm4_moe", "Glm4MoeModel"),176        ("glm4v", "Glm4vModel"),177        ("glm4v_moe", "Glm4vMoeModel"),178        ("glm4v_moe_text", "Glm4vMoeTextModel"),179        ("glm4v_text", "Glm4vTextModel"),180        ("glpn", "GLPNModel"),181        ("got_ocr2", "GotOcr2Model"),182        ("gpt-sw3", "GPT2Model"),183        ("gpt2", "GPT2Model"),184        ("gpt_bigcode", "GPTBigCodeModel"),185        ("gpt_neo", "GPTNeoModel"),186        ("gpt_neox", "GPTNeoXModel"),187        ("gpt_neox_japanese", "GPTNeoXJapaneseModel"),188        ("gpt_oss", "GptOssModel"),189        ("gptj", "GPTJModel"),190        ("gptsan-japanese", "GPTSanJapaneseForConditionalGeneration"),191        ("granite", "GraniteModel"),192        ("granitemoe", "GraniteMoeModel"),193        ("granitemoehybrid", "GraniteMoeHybridModel"),194        ("granitemoeshared", "GraniteMoeSharedModel"),195        ("graphormer", "GraphormerModel"),196        ("grounding-dino", "GroundingDinoModel"),197        ("groupvit", "GroupViTModel"),198        ("helium", "HeliumModel"),199        ("hgnet_v2", "HGNetV2Backbone"),200        ("hiera", "HieraModel"),201        ("hubert", "HubertModel"),202        ("hunyuan_v1_dense", "HunYuanDenseV1Model"),203        ("hunyuan_v1_moe", "HunYuanMoEV1Model"),204        ("ibert", "IBertModel"),205        ("idefics", "IdeficsModel"),206        ("idefics2", "Idefics2Model"),207        ("idefics3", "Idefics3Model"),208        ("idefics3_vision", "Idefics3VisionTransformer"),209        ("ijepa", "IJepaModel"),210        ("imagegpt", "ImageGPTModel"),211        ("informer", "InformerModel"),212        ("instructblip", "InstructBlipModel"),213        ("instructblipvideo", "InstructBlipVideoModel"),214        ("internvl", "InternVLModel"),215        ("internvl_vision", "InternVLVisionModel"),216        ("jamba", "JambaModel"),217        ("janus", "JanusModel"),218        ("jetmoe", "JetMoeModel"),219        ("jukebox", "JukeboxModel"),220        ("kosmos-2", "Kosmos2Model"),221        ("kosmos-2.5", "Kosmos2_5Model"),222        ("kyutai_speech_to_text", "KyutaiSpeechToTextModel"),223        ("layoutlm", "LayoutLMModel"),224        ("layoutlmv2", "LayoutLMv2Model"),225        ("layoutlmv3", "LayoutLMv3Model"),226        ("led", "LEDModel"),227        ("levit", "LevitModel"),228        ("lfm2", "Lfm2Model"),229        ("lfm2_vl", "Lfm2VlModel"),230        ("lightglue", "LightGlueForKeypointMatching"),231        ("lilt", "LiltModel"),232        ("llama", "LlamaModel"),233        ("llama4", "Llama4ForConditionalGeneration"),234        ("llama4_text", "Llama4TextModel"),235        ("llava", "LlavaModel"),236        ("llava_next", "LlavaNextModel"),237        ("llava_next_video", "LlavaNextVideoModel"),238        ("llava_onevision", "LlavaOnevisionModel"),239        ("longcat_flash", "LongcatFlashModel"),240        ("longformer", "LongformerModel"),241        ("longt5", "LongT5Model"),242        ("luke", "LukeModel"),243        ("lxmert", "LxmertModel"),244        ("m2m_100", "M2M100Model"),245        ("mamba", "MambaModel"),246        ("mamba2", "Mamba2Model"),247        ("marian", "MarianModel"),248        ("markuplm", "MarkupLMModel"),249        ("mask2former", "Mask2FormerModel"),250        ("maskformer", "MaskFormerModel"),251        ("maskformer-swin", "MaskFormerSwinModel"),252        ("mbart", "MBartModel"),253        ("mctct", "MCTCTModel"),254        ("mega", "MegaModel"),255        ("megatron-bert", "MegatronBertModel"),256        ("metaclip_2", "MetaClip2Model"),257        ("mgp-str", "MgpstrForSceneTextRecognition"),258        ("mimi", "MimiModel"),259        ("minimax", "MiniMaxModel"),260        ("ministral", "MinistralModel"),261        ("mistral", "MistralModel"),262        ("mistral3", "Mistral3Model"),263        ("mixtral", "MixtralModel"),264        ("mlcd", "MLCDVisionModel"),265        ("mllama", "MllamaModel"),266        ("mm-grounding-dino", "MMGroundingDinoModel"),267        ("mobilebert", "MobileBertModel"),268        ("mobilenet_v1", "MobileNetV1Model"),269        ("mobilenet_v2", "MobileNetV2Model"),270        ("mobilevit", "MobileViTModel"),271        ("mobilevitv2", "MobileViTV2Model"),272        ("modernbert", "ModernBertModel"),273        ("modernbert-decoder", "ModernBertDecoderModel"),274        ("moonshine", "MoonshineModel"),275        ("moshi", "MoshiModel"),276        ("mpnet", "MPNetModel"),277        ("mpt", "MptModel"),278        ("mra", "MraModel"),279        ("mt5", "MT5Model"),280        ("musicgen", "MusicgenModel"),281        ("musicgen_melody", "MusicgenMelodyModel"),282        ("mvp", "MvpModel"),283        ("nat", "NatModel"),284        ("nemotron", "NemotronModel"),285        ("nezha", "NezhaModel"),286        ("nllb-moe", "NllbMoeModel"),287        ("nystromformer", "NystromformerModel"),288        ("olmo", "OlmoModel"),289        ("olmo2", "Olmo2Model"),290        ("olmo3", "Olmo3Model"),291        ("olmoe", "OlmoeModel"),292        ("omdet-turbo", "OmDetTurboForObjectDetection"),293        ("oneformer", "OneFormerModel"),294        ("open-llama", "OpenLlamaModel"),295        ("openai-gpt", "OpenAIGPTModel"),296        ("opt", "OPTModel"),297        ("ovis2", "Ovis2Model"),298        ("owlv2", "Owlv2Model"),299        ("owlvit", "OwlViTModel"),300        ("paligemma", "PaliGemmaModel"),301        ("parakeet_ctc", "ParakeetForCTC"),302        ("parakeet_encoder", "ParakeetEncoder"),303        ("patchtsmixer", "PatchTSMixerModel"),304        ("patchtst", "PatchTSTModel"),305        ("pegasus", "PegasusModel"),306        ("pegasus_x", "PegasusXModel"),307        ("perceiver", "PerceiverModel"),308        ("perception_encoder", "PerceptionEncoder"),309        ("perception_lm", "PerceptionLMModel"),310        ("persimmon", "PersimmonModel"),311        ("phi", "PhiModel"),312        ("phi3", "Phi3Model"),313        ("phi4_multimodal", "Phi4MultimodalModel"),314        ("phimoe", "PhimoeModel"),315        ("pixtral", "PixtralVisionModel"),316        ("plbart", "PLBartModel"),317        ("poolformer", "PoolFormerModel"),318        ("prophetnet", "ProphetNetModel"),319        ("pvt", "PvtModel"),320        ("pvt_v2", "PvtV2Model"),321        ("qdqbert", "QDQBertModel"),322        ("qwen2", "Qwen2Model"),323        ("qwen2_5_vl", "Qwen2_5_VLModel"),324        ("qwen2_5_vl_text", "Qwen2_5_VLTextModel"),325        ("qwen2_audio_encoder", "Qwen2AudioEncoder"),326        ("qwen2_moe", "Qwen2MoeModel"),327        ("qwen2_vl", "Qwen2VLModel"),328        ("qwen2_vl_text", "Qwen2VLTextModel"),329        ("qwen3", "Qwen3Model"),330        ("qwen3_moe", "Qwen3MoeModel"),331        ("qwen3_next", "Qwen3NextModel"),332        ("qwen3_vl", "Qwen3VLModel"),333        ("qwen3_vl_moe", "Qwen3VLMoeModel"),334        ("qwen3_vl_moe_text", "Qwen3VLMoeTextModel"),335        ("qwen3_vl_text", "Qwen3VLTextModel"),336        ("recurrent_gemma", "RecurrentGemmaModel"),337        ("reformer", "ReformerModel"),338        ("regnet", "RegNetModel"),339        ("rembert", "RemBertModel"),340        ("resnet", "ResNetModel"),341        ("retribert", "RetriBertModel"),342        ("roberta", "RobertaModel"),343        ("roberta-prelayernorm", "RobertaPreLayerNormModel"),344        ("roc_bert", "RoCBertModel"),345        ("roformer", "RoFormerModel"),346        ("rt_detr", "RTDetrModel"),347        ("rt_detr_v2", "RTDetrV2Model"),348        ("rwkv", "RwkvModel"),349        ("sam", "SamModel"),350        ("sam2", "Sam2Model"),351        ("sam2_hiera_det_model", "Sam2HieraDetModel"),352        ("sam2_video", "Sam2VideoModel"),353        ("sam2_vision_model", "Sam2VisionModel"),354        ("sam_hq", "SamHQModel"),355        ("sam_hq_vision_model", "SamHQVisionModel"),356        ("sam_vision_model", "SamVisionModel"),357        ("seamless_m4t", "SeamlessM4TModel"),358        ("seamless_m4t_v2", "SeamlessM4Tv2Model"),359        ("seed_oss", "SeedOssModel"),360        ("segformer", "SegformerModel"),361        ("seggpt", "SegGptModel"),362        ("sew", "SEWModel"),363        ("sew-d", "SEWDModel"),364        ("siglip", "SiglipModel"),365        ("siglip2", "Siglip2Model"),366        ("siglip2_vision_model", "Siglip2VisionModel"),367        ("siglip_vision_model", "SiglipVisionModel"),368        ("smollm3", "SmolLM3Model"),369        ("smolvlm", "SmolVLMModel"),370        ("smolvlm_vision", "SmolVLMVisionTransformer"),371        ("speech_to_text", "Speech2TextModel"),372        ("speecht5", "SpeechT5Model"),373        ("splinter", "SplinterModel"),374        ("squeezebert", "SqueezeBertModel"),375        ("stablelm", "StableLmModel"),376        ("starcoder2", "Starcoder2Model"),377        ("swiftformer", "SwiftFormerModel"),378        ("swin", "SwinModel"),379        ("swin2sr", "Swin2SRModel"),380        ("swinv2", "Swinv2Model"),381        ("switch_transformers", "SwitchTransformersModel"),382        ("t5", "T5Model"),383        ("t5gemma", "T5GemmaModel"),384        ("table-transformer", "TableTransformerModel"),385        ("tapas", "TapasModel"),386        ("textnet", "TextNetModel"),387        ("time_series_transformer", "TimeSeriesTransformerModel"),388        ("timesfm", "TimesFmModel"),389        ("timesformer", "TimesformerModel"),390        ("timm_backbone", "TimmBackbone"),391        ("timm_wrapper", "TimmWrapperModel"),392        ("trajectory_transformer", "TrajectoryTransformerModel"),393        ("transfo-xl", "TransfoXLModel"),394        ("tvlt", "TvltModel"),395        ("tvp", "TvpModel"),396        ("udop", "UdopModel"),397        ("umt5", "UMT5Model"),398        ("unispeech", "UniSpeechModel"),399        ("unispeech-sat", "UniSpeechSatModel"),400        ("univnet", "UnivNetModel"),401        ("van", "VanModel"),402        ("vaultgemma", "VaultGemmaModel"),403        ("video_llava", "VideoLlavaModel"),404        ("videomae", "VideoMAEModel"),405        ("vilt", "ViltModel"),406        ("vipllava", "VipLlavaModel"),407        ("vision-text-dual-encoder", "VisionTextDualEncoderModel"),408        ("visual_bert", "VisualBertModel"),409        ("vit", "ViTModel"),410        ("vit_hybrid", "ViTHybridModel"),411        ("vit_mae", "ViTMAEModel"),412        ("vit_msn", "ViTMSNModel"),413        ("vitdet", "VitDetModel"),414        ("vits", "VitsModel"),415        ("vivit", "VivitModel"),416        ("vjepa2", "VJEPA2Model"),417        ("voxtral", "VoxtralForConditionalGeneration"),418        ("voxtral_encoder", "VoxtralEncoder"),419        ("wav2vec2", "Wav2Vec2Model"),420        ("wav2vec2-bert", "Wav2Vec2BertModel"),421        ("wav2vec2-conformer", "Wav2Vec2ConformerModel"),422        ("wavlm", "WavLMModel"),423        ("whisper", "WhisperModel"),424        ("xclip", "XCLIPModel"),425        ("xcodec", "XcodecModel"),426        ("xglm", "XGLMModel"),427        ("xlm", "XLMModel"),428        ("xlm-prophetnet", "XLMProphetNetModel"),429        ("xlm-roberta", "XLMRobertaModel"),430        ("xlm-roberta-xl", "XLMRobertaXLModel"),431        ("xlnet", "XLNetModel"),432        ("xlstm", "xLSTMModel"),433        ("xmod", "XmodModel"),434        ("yolos", "YolosModel"),435        ("yoso", "YosoModel"),436        ("zamba", "ZambaModel"),437        ("zamba2", "Zamba2Model"),438    ]439)440 441MODEL_FOR_PRETRAINING_MAPPING_NAMES = OrderedDict(442    [443        # Model for pre-training mapping444        ("albert", "AlbertForPreTraining"),445        ("bart", "BartForConditionalGeneration"),446        ("bert", "BertForPreTraining"),447        ("big_bird", "BigBirdForPreTraining"),448        ("bloom", "BloomForCausalLM"),449        ("camembert", "CamembertForMaskedLM"),450        ("colpali", "ColPaliForRetrieval"),451        ("colqwen2", "ColQwen2ForRetrieval"),452        ("ctrl", "CTRLLMHeadModel"),453        ("data2vec-text", "Data2VecTextForMaskedLM"),454        ("deberta", "DebertaForMaskedLM"),455        ("deberta-v2", "DebertaV2ForMaskedLM"),456        ("distilbert", "DistilBertForMaskedLM"),457        ("electra", "ElectraForPreTraining"),458        ("ernie", "ErnieForPreTraining"),459        ("evolla", "EvollaForProteinText2Text"),460        ("exaone4", "Exaone4ForCausalLM"),461        ("falcon_mamba", "FalconMambaForCausalLM"),462        ("flaubert", "FlaubertWithLMHeadModel"),463        ("flava", "FlavaForPreTraining"),464        ("florence2", "Florence2ForConditionalGeneration"),465        ("fnet", "FNetForPreTraining"),466        ("fsmt", "FSMTForConditionalGeneration"),467        ("funnel", "FunnelForPreTraining"),468        ("gemma3", "Gemma3ForConditionalGeneration"),469        ("gpt-sw3", "GPT2LMHeadModel"),470        ("gpt2", "GPT2LMHeadModel"),471        ("gpt_bigcode", "GPTBigCodeForCausalLM"),472        ("gptsan-japanese", "GPTSanJapaneseForConditionalGeneration"),473        ("hiera", "HieraForPreTraining"),474        ("ibert", "IBertForMaskedLM"),475        ("idefics", "IdeficsForVisionText2Text"),476        ("idefics2", "Idefics2ForConditionalGeneration"),477        ("idefics3", "Idefics3ForConditionalGeneration"),478        ("janus", "JanusForConditionalGeneration"),479        ("layoutlm", "LayoutLMForMaskedLM"),480        ("llava", "LlavaForConditionalGeneration"),481        ("llava_next", "LlavaNextForConditionalGeneration"),482        ("llava_next_video", "LlavaNextVideoForConditionalGeneration"),483        ("llava_onevision", "LlavaOnevisionForConditionalGeneration"),484        ("longformer", "LongformerForMaskedLM"),485        ("luke", "LukeForMaskedLM"),486        ("lxmert", "LxmertForPreTraining"),487        ("mamba", "MambaForCausalLM"),488        ("mamba2", "Mamba2ForCausalLM"),489        ("mega", "MegaForMaskedLM"),490        ("megatron-bert", "MegatronBertForPreTraining"),491        ("mistral3", "Mistral3ForConditionalGeneration"),492        ("mllama", "MllamaForConditionalGeneration"),493        ("mobilebert", "MobileBertForPreTraining"),494        ("mpnet", "MPNetForMaskedLM"),495        ("mpt", "MptForCausalLM"),496        ("mra", "MraForMaskedLM"),497        ("mvp", "MvpForConditionalGeneration"),498        ("nezha", "NezhaForPreTraining"),499        ("nllb-moe", "NllbMoeForConditionalGeneration"),500        ("openai-gpt", "OpenAIGPTLMHeadModel"),501        ("paligemma", "PaliGemmaForConditionalGeneration"),502        ("qwen2_audio", "Qwen2AudioForConditionalGeneration"),503        ("retribert", "RetriBertModel"),504        ("roberta", "RobertaForMaskedLM"),505        ("roberta-prelayernorm", "RobertaPreLayerNormForMaskedLM"),506        ("roc_bert", "RoCBertForPreTraining"),507        ("rwkv", "RwkvForCausalLM"),508        ("splinter", "SplinterForPreTraining"),509        ("squeezebert", "SqueezeBertForMaskedLM"),510        ("switch_transformers", "SwitchTransformersForConditionalGeneration"),511        ("t5", "T5ForConditionalGeneration"),512        ("t5gemma", "T5GemmaForConditionalGeneration"),513        ("tapas", "TapasForMaskedLM"),514        ("transfo-xl", "TransfoXLLMHeadModel"),515        ("tvlt", "TvltForPreTraining"),516        ("unispeech", "UniSpeechForPreTraining"),517        ("unispeech-sat", "UniSpeechSatForPreTraining"),518        ("video_llava", "VideoLlavaForConditionalGeneration"),519        ("videomae", "VideoMAEForPreTraining"),520        ("vipllava", "VipLlavaForConditionalGeneration"),521        ("visual_bert", "VisualBertForPreTraining"),522        ("vit_mae", "ViTMAEForPreTraining"),523        ("voxtral", "VoxtralForConditionalGeneration"),524        ("wav2vec2", "Wav2Vec2ForPreTraining"),525        ("wav2vec2-conformer", "Wav2Vec2ConformerForPreTraining"),526        ("xlm", "XLMWithLMHeadModel"),527        ("xlm-roberta", "XLMRobertaForMaskedLM"),528        ("xlm-roberta-xl", "XLMRobertaXLForMaskedLM"),529        ("xlnet", "XLNetLMHeadModel"),530        ("xlstm", "xLSTMForCausalLM"),531        ("xmod", "XmodForMaskedLM"),532    ]533)534 535MODEL_WITH_LM_HEAD_MAPPING_NAMES = OrderedDict(536    [537        # Model with LM heads mapping538        ("albert", "AlbertForMaskedLM"),539        ("bart", "BartForConditionalGeneration"),540        ("bert", "BertForMaskedLM"),541        ("big_bird", "BigBirdForMaskedLM"),542        ("bigbird_pegasus", "BigBirdPegasusForConditionalGeneration"),543        ("blenderbot-small", "BlenderbotSmallForConditionalGeneration"),544        ("bloom", "BloomForCausalLM"),545        ("camembert", "CamembertForMaskedLM"),546        ("codegen", "CodeGenForCausalLM"),547        ("convbert", "ConvBertForMaskedLM"),548        ("cpmant", "CpmAntForCausalLM"),549        ("ctrl", "CTRLLMHeadModel"),550        ("data2vec-text", "Data2VecTextForMaskedLM"),551        ("deberta", "DebertaForMaskedLM"),552        ("deberta-v2", "DebertaV2ForMaskedLM"),553        ("dia", "DiaForConditionalGeneration"),554        ("distilbert", "DistilBertForMaskedLM"),555        ("electra", "ElectraForMaskedLM"),556        ("encoder-decoder", "EncoderDecoderModel"),557        ("ernie", "ErnieForMaskedLM"),558        ("esm", "EsmForMaskedLM"),559        ("exaone4", "Exaone4ForCausalLM"),560        ("falcon_mamba", "FalconMambaForCausalLM"),561        ("flaubert", "FlaubertWithLMHeadModel"),562        ("fnet", "FNetForMaskedLM"),563        ("fsmt", "FSMTForConditionalGeneration"),564        ("funnel", "FunnelForMaskedLM"),565        ("git", "GitForCausalLM"),566        ("gpt-sw3", "GPT2LMHeadModel"),567        ("gpt2", "GPT2LMHeadModel"),568        ("gpt_bigcode", "GPTBigCodeForCausalLM"),569        ("gpt_neo", "GPTNeoForCausalLM"),570        ("gpt_neox", "GPTNeoXForCausalLM"),571        ("gpt_neox_japanese", "GPTNeoXJapaneseForCausalLM"),572        ("gptj", "GPTJForCausalLM"),573        ("gptsan-japanese", "GPTSanJapaneseForConditionalGeneration"),574        ("ibert", "IBertForMaskedLM"),575        ("layoutlm", "LayoutLMForMaskedLM"),576        ("led", "LEDForConditionalGeneration"),577        ("longformer", "LongformerForMaskedLM"),578        ("longt5", "LongT5ForConditionalGeneration"),579        ("luke", "LukeForMaskedLM"),580        ("m2m_100", "M2M100ForConditionalGeneration"),581        ("mamba", "MambaForCausalLM"),582        ("mamba2", "Mamba2ForCausalLM"),583        ("marian", "MarianMTModel"),584        ("mega", "MegaForMaskedLM"),585        ("megatron-bert", "MegatronBertForCausalLM"),586        ("mobilebert", "MobileBertForMaskedLM"),587        ("moonshine", "MoonshineForConditionalGeneration"),588        ("mpnet", "MPNetForMaskedLM"),589        ("mpt", "MptForCausalLM"),590        ("mra", "MraForMaskedLM"),591        ("mvp", "MvpForConditionalGeneration"),592        ("nezha", "NezhaForMaskedLM"),593        ("nllb-moe", "NllbMoeForConditionalGeneration"),594        ("nystromformer", "NystromformerForMaskedLM"),595        ("openai-gpt", "OpenAIGPTLMHeadModel"),596        ("pegasus_x", "PegasusXForConditionalGeneration"),597        ("plbart", "PLBartForConditionalGeneration"),598        ("pop2piano", "Pop2PianoForConditionalGeneration"),599        ("qdqbert", "QDQBertForMaskedLM"),600        ("reformer", "ReformerModelWithLMHead"),601        ("rembert", "RemBertForMaskedLM"),602        ("roberta", "RobertaForMaskedLM"),603        ("roberta-prelayernorm", "RobertaPreLayerNormForMaskedLM"),604        ("roc_bert", "RoCBertForMaskedLM"),605        ("roformer", "RoFormerForMaskedLM"),606        ("rwkv", "RwkvForCausalLM"),607        ("speech_to_text", "Speech2TextForConditionalGeneration"),608        ("squeezebert", "SqueezeBertForMaskedLM"),609        ("switch_transformers", "SwitchTransformersForConditionalGeneration"),610        ("t5", "T5ForConditionalGeneration"),611        ("t5gemma", "T5GemmaForConditionalGeneration"),612        ("tapas", "TapasForMaskedLM"),613        ("transfo-xl", "TransfoXLLMHeadModel"),614        ("wav2vec2", "Wav2Vec2ForMaskedLM"),615        ("whisper", "WhisperForConditionalGeneration"),616        ("xlm", "XLMWithLMHeadModel"),617        ("xlm-roberta", "XLMRobertaForMaskedLM"),618        ("xlm-roberta-xl", "XLMRobertaXLForMaskedLM"),619        ("xlnet", "XLNetLMHeadModel"),620        ("xmod", "XmodForMaskedLM"),621        ("yoso", "YosoForMaskedLM"),622    ]623)624 625MODEL_FOR_CAUSAL_LM_MAPPING_NAMES = OrderedDict(626    [627        # Model for Causal LM mapping628        ("apertus", "ApertusForCausalLM"),629        ("arcee", "ArceeForCausalLM"),630        ("aria_text", "AriaTextForCausalLM"),631        ("bamba", "BambaForCausalLM"),632        ("bart", "BartForCausalLM"),633        ("bert", "BertLMHeadModel"),634        ("bert-generation", "BertGenerationDecoder"),635        ("big_bird", "BigBirdForCausalLM"),636        ("bigbird_pegasus", "BigBirdPegasusForCausalLM"),637        ("biogpt", "BioGptForCausalLM"),638        ("bitnet", "BitNetForCausalLM"),639        ("blenderbot", "BlenderbotForCausalLM"),640        ("blenderbot-small", "BlenderbotSmallForCausalLM"),641        ("bloom", "BloomForCausalLM"),642        ("blt", "BltForCausalLM"),643        ("camembert", "CamembertForCausalLM"),644        ("code_llama", "LlamaForCausalLM"),645        ("codegen", "CodeGenForCausalLM"),646        ("cohere", "CohereForCausalLM"),647        ("cohere2", "Cohere2ForCausalLM"),648        ("cpmant", "CpmAntForCausalLM"),649        ("ctrl", "CTRLLMHeadModel"),650        ("data2vec-text", "Data2VecTextForCausalLM"),651        ("dbrx", "DbrxForCausalLM"),652        ("deepseek_v2", "DeepseekV2ForCausalLM"),653        ("deepseek_v3", "DeepseekV3ForCausalLM"),654        ("diffllama", "DiffLlamaForCausalLM"),655        ("doge", "DogeForCausalLM"),656        ("dots1", "Dots1ForCausalLM"),657        ("electra", "ElectraForCausalLM"),658        ("emu3", "Emu3ForCausalLM"),659        ("ernie", "ErnieForCausalLM"),660        ("ernie4_5", "Ernie4_5ForCausalLM"),661        ("ernie4_5_moe", "Ernie4_5_MoeForCausalLM"),662        ("exaone4", "Exaone4ForCausalLM"),663        ("falcon", "FalconForCausalLM"),664        ("falcon_h1", "FalconH1ForCausalLM"),665        ("falcon_mamba", "FalconMambaForCausalLM"),666        ("flex_olmo", "FlexOlmoForCausalLM"),667        ("fuyu", "FuyuForCausalLM"),668        ("gemma", "GemmaForCausalLM"),669        ("gemma2", "Gemma2ForCausalLM"),670        ("gemma3", "Gemma3ForConditionalGeneration"),671        ("gemma3_text", "Gemma3ForCausalLM"),672        ("gemma3n", "Gemma3nForConditionalGeneration"),673        ("gemma3n_text", "Gemma3nForCausalLM"),674        ("git", "GitForCausalLM"),675        ("glm", "GlmForCausalLM"),676        ("glm4", "Glm4ForCausalLM"),677        ("glm4_moe", "Glm4MoeForCausalLM"),678        ("got_ocr2", "GotOcr2ForConditionalGeneration"),679        ("gpt-sw3", "GPT2LMHeadModel"),680        ("gpt2", "GPT2LMHeadModel"),681        ("gpt_bigcode", "GPTBigCodeForCausalLM"),682        ("gpt_neo", "GPTNeoForCausalLM"),683        ("gpt_neox", "GPTNeoXForCausalLM"),684        ("gpt_neox_japanese", "GPTNeoXJapaneseForCausalLM"),685        ("gpt_oss", "GptOssForCausalLM"),686        ("gptj", "GPTJForCausalLM"),687        ("granite", "GraniteForCausalLM"),688        ("granitemoe", "GraniteMoeForCausalLM"),689        ("granitemoehybrid", "GraniteMoeHybridForCausalLM"),690        ("granitemoeshared", "GraniteMoeSharedForCausalLM"),691        ("helium", "HeliumForCausalLM"),692        ("hunyuan_v1_dense", "HunYuanDenseV1ForCausalLM"),693        ("hunyuan_v1_moe", "HunYuanMoEV1ForCausalLM"),694        ("jamba", "JambaForCausalLM"),695        ("jetmoe", "JetMoeForCausalLM"),696        ("lfm2", "Lfm2ForCausalLM"),697        ("llama", "LlamaForCausalLM"),698        ("llama4", "Llama4ForCausalLM"),699        ("llama4_text", "Llama4ForCausalLM"),700        ("longcat_flash", "LongcatFlashForCausalLM"),701        ("mamba", "MambaForCausalLM"),702        ("mamba2", "Mamba2ForCausalLM"),703        ("marian", "MarianForCausalLM"),704        ("mbart", "MBartForCausalLM"),705        ("mega", "MegaForCausalLM"),706        ("megatron-bert", "MegatronBertForCausalLM"),707        ("minimax", "MiniMaxForCausalLM"),708        ("ministral", "MinistralForCausalLM"),709        ("mistral", "MistralForCausalLM"),710        ("mixtral", "MixtralForCausalLM"),711        ("mllama", "MllamaForCausalLM"),712        ("modernbert-decoder", "ModernBertDecoderForCausalLM"),713        ("moshi", "MoshiForCausalLM"),714        ("mpt", "MptForCausalLM"),715        ("musicgen", "MusicgenForCausalLM"),716        ("musicgen_melody", "MusicgenMelodyForCausalLM"),717        ("mvp", "MvpForCausalLM"),718        ("nemotron", "NemotronForCausalLM"),719        ("olmo", "OlmoForCausalLM"),720        ("olmo2", "Olmo2ForCausalLM"),721        ("olmo3", "Olmo3ForCausalLM"),722        ("olmoe", "OlmoeForCausalLM"),723        ("open-llama", "OpenLlamaForCausalLM"),724        ("openai-gpt", "OpenAIGPTLMHeadModel"),725        ("opt", "OPTForCausalLM"),726        ("pegasus", "PegasusForCausalLM"),727        ("persimmon", "PersimmonForCausalLM"),728        ("phi", "PhiForCausalLM"),729        ("phi3", "Phi3ForCausalLM"),730        ("phi4_multimodal", "Phi4MultimodalForCausalLM"),731        ("phimoe", "PhimoeForCausalLM"),732        ("plbart", "PLBartForCausalLM"),733        ("prophetnet", "ProphetNetForCausalLM"),734        ("qdqbert", "QDQBertLMHeadModel"),735        ("qwen2", "Qwen2ForCausalLM"),736        ("qwen2_moe", "Qwen2MoeForCausalLM"),737        ("qwen3", "Qwen3ForCausalLM"),738        ("qwen3_moe", "Qwen3MoeForCausalLM"),739        ("qwen3_next", "Qwen3NextForCausalLM"),740        ("recurrent_gemma", "RecurrentGemmaForCausalLM"),741        ("reformer", "ReformerModelWithLMHead"),742        ("rembert", "RemBertForCausalLM"),743        ("roberta", "RobertaForCausalLM"),744        ("roberta-prelayernorm", "RobertaPreLayerNormForCausalLM"),745        ("roc_bert", "RoCBertForCausalLM"),746        ("roformer", "RoFormerForCausalLM"),747        ("rwkv", "RwkvForCausalLM"),748        ("seed_oss", "SeedOssForCausalLM"),749        ("smollm3", "SmolLM3ForCausalLM"),750        ("speech_to_text_2", "Speech2Text2ForCausalLM"),751        ("stablelm", "StableLmForCausalLM"),752        ("starcoder2", "Starcoder2ForCausalLM"),753        ("transfo-xl", "TransfoXLLMHeadModel"),754        ("trocr", "TrOCRForCausalLM"),755        ("vaultgemma", "VaultGemmaForCausalLM"),756        ("whisper", "WhisperForCausalLM"),757        ("xglm", "XGLMForCausalLM"),758        ("xlm", "XLMWithLMHeadModel"),759        ("xlm-prophetnet", "XLMProphetNetForCausalLM"),760        ("xlm-roberta", "XLMRobertaForCausalLM"),761        ("xlm-roberta-xl", "XLMRobertaXLForCausalLM"),762        ("xlnet", "XLNetLMHeadModel"),763        ("xlstm", "xLSTMForCausalLM"),764        ("xmod", "XmodForCausalLM"),765        ("zamba", "ZambaForCausalLM"),766        ("zamba2", "Zamba2ForCausalLM"),767    ]768)769 770MODEL_FOR_IMAGE_MAPPING_NAMES = OrderedDict(771    [772        # Model for Image mapping773        ("aimv2_vision_model", "Aimv2VisionModel"),774        ("beit", "BeitModel"),775        ("bit", "BitModel"),776        ("cohere2_vision", "Cohere2VisionModel"),777        ("conditional_detr", "ConditionalDetrModel"),778        ("convnext", "ConvNextModel"),779        ("convnextv2", "ConvNextV2Model"),780        ("dab-detr", "DabDetrModel"),781        ("data2vec-vision", "Data2VecVisionModel"),782        ("deformable_detr", "DeformableDetrModel"),783        ("deit", "DeiTModel"),784        ("depth_pro", "DepthProModel"),785        ("deta", "DetaModel"),786        ("detr", "DetrModel"),787        ("dinat", "DinatModel"),788        ("dinov2", "Dinov2Model"),789        ("dinov2_with_registers", "Dinov2WithRegistersModel"),790        ("dinov3_convnext", "DINOv3ConvNextModel"),791        ("dinov3_vit", "DINOv3ViTModel"),792        ("dpt", "DPTModel"),793        ("efficientformer", "EfficientFormerModel"),794        ("efficientnet", "EfficientNetModel"),795        ("focalnet", "FocalNetModel"),796        ("glpn", "GLPNModel"),797        ("hiera", "HieraModel"),798        ("ijepa", "IJepaModel"),799        ("imagegpt", "ImageGPTModel"),800        ("levit", "LevitModel"),801        ("llama4", "Llama4VisionModel"),802        ("mlcd", "MLCDVisionModel"),803        ("mllama", "MllamaVisionModel"),804        ("mobilenet_v1", "MobileNetV1Model"),805        ("mobilenet_v2", "MobileNetV2Model"),806        ("mobilevit", "MobileViTModel"),807        ("mobilevitv2", "MobileViTV2Model"),808        ("nat", "NatModel"),809        ("poolformer", "PoolFormerModel"),810        ("pvt", "PvtModel"),811        ("regnet", "RegNetModel"),812        ("resnet", "ResNetModel"),813        ("segformer", "SegformerModel"),814        ("siglip_vision_model", "SiglipVisionModel"),815        ("swiftformer", "SwiftFormerModel"),816        ("swin", "SwinModel"),817        ("swin2sr", "Swin2SRModel"),818        ("swinv2", "Swinv2Model"),819        ("table-transformer", "TableTransformerModel"),820        ("timesformer", "TimesformerModel"),821        ("timm_backbone", "TimmBackbone"),822        ("timm_wrapper", "TimmWrapperModel"),823        ("van", "VanModel"),824        ("videomae", "VideoMAEModel"),825        ("vit", "ViTModel"),826        ("vit_hybrid", "ViTHybridModel"),827        ("vit_mae", "ViTMAEModel"),828        ("vit_msn", "ViTMSNModel"),829        ("vitdet", "VitDetModel"),830        ("vivit", "VivitModel"),831        ("yolos", "YolosModel"),832    ]833)834 835MODEL_FOR_MASKED_IMAGE_MODELING_MAPPING_NAMES = OrderedDict(836    [837        ("deit", "DeiTForMaskedImageModeling"),838        ("focalnet", "FocalNetForMaskedImageModeling"),839        ("swin", "SwinForMaskedImageModeling"),840        ("swinv2", "Swinv2ForMaskedImageModeling"),841        ("vit", "ViTForMaskedImageModeling"),842    ]843)844 845 846MODEL_FOR_CAUSAL_IMAGE_MODELING_MAPPING_NAMES = OrderedDict(847    # Model for Causal Image Modeling mapping848    [849        ("imagegpt", "ImageGPTForCausalImageModeling"),850    ]851)852 853MODEL_FOR_IMAGE_CLASSIFICATION_MAPPING_NAMES = OrderedDict(854    [855        # Model for Image Classification mapping856        ("beit", "BeitForImageClassification"),857        ("bit", "BitForImageClassification"),858        ("clip", "CLIPForImageClassification"),859        ("convnext", "ConvNextForImageClassification"),860        ("convnextv2", "ConvNextV2ForImageClassification"),861        ("cvt", "CvtForImageClassification"),862        ("data2vec-vision", "Data2VecVisionForImageClassification"),863        (864            "deit",865            ("DeiTForImageClassification", "DeiTForImageClassificationWithTeacher"),866        ),867        ("dinat", "DinatForImageClassification"),868        ("dinov2", "Dinov2ForImageClassification"),869        ("dinov2_with_registers", "Dinov2WithRegistersForImageClassification"),870        ("donut-swin", "DonutSwinForImageClassification"),871        (872            "efficientformer",873            (874                "EfficientFormerForImageClassification",875                "EfficientFormerForImageClassificationWithTeacher",876            ),877        ),878        ("efficientnet", "EfficientNetForImageClassification"),879        ("focalnet", "FocalNetForImageClassification"),880        ("hgnet_v2", "HGNetV2ForImageClassification"),881        ("hiera", "HieraForImageClassification"),882        ("ijepa", "IJepaForImageClassification"),883        ("imagegpt", "ImageGPTForImageClassification"),884        (885            "levit",886            ("LevitForImageClassification", "LevitForImageClassificationWithTeacher"),887        ),888        ("metaclip_2", "MetaClip2ForImageClassification"),889        ("mobilenet_v1", "MobileNetV1ForImageClassification"),890        ("mobilenet_v2", "MobileNetV2ForImageClassification"),891        ("mobilevit", "MobileViTForImageClassification"),892        ("mobilevitv2", "MobileViTV2ForImageClassification"),893        ("nat", "NatForImageClassification"),894        (895            "perceiver",896            (897                "PerceiverForImageClassificationLearned",898                "PerceiverForImageClassificationFourier",899                "PerceiverForImageClassificationConvProcessing",900            ),901        ),902        ("poolformer", "PoolFormerForImageClassification"),903        ("pvt", "PvtForImageClassification"),904        ("pvt_v2", "PvtV2ForImageClassification"),905        ("regnet", "RegNetForImageClassification"),906        ("resnet", "ResNetForImageClassification"),907        ("segformer", "SegformerForImageClassification"),908        ("shieldgemma2", "ShieldGemma2ForImageClassification"),909        ("siglip", "SiglipForImageClassification"),910        ("siglip2", "Siglip2ForImageClassification"),911        ("swiftformer", "SwiftFormerForImageClassification"),912        ("swin", "SwinForImageClassification"),913        ("swinv2", "Swinv2ForImageClassification"),914        ("textnet", "TextNetForImageClassification"),915        ("timm_wrapper", "TimmWrapperForImageClassification"),916        ("van", "VanForImageClassification"),917        ("vit", "ViTForImageClassification"),918        ("vit_hybrid", "ViTHybridForImageClassification"),919        ("vit_msn", "ViTMSNForImageClassification"),920    ]921)922 923MODEL_FOR_IMAGE_SEGMENTATION_MAPPING_NAMES = OrderedDict(924    [925        # Do not add new models here, this class will be deprecated in the future.926        # Model for Image Segmentation mapping927        ("detr", "DetrForSegmentation"),928    ]929)930 931MODEL_FOR_SEMANTIC_SEGMENTATION_MAPPING_NAMES = OrderedDict(932    [933        # Model for Semantic Segmentation mapping934        ("beit", "BeitForSemanticSegmentation"),935        ("data2vec-vision", "Data2VecVisionForSemanticSegmentation"),936        ("dpt", "DPTForSemanticSegmentation"),937        ("mobilenet_v2", "MobileNetV2ForSemanticSegmentation"),938        ("mobilevit", "MobileViTForSemanticSegmentation"),939        ("mobilevitv2", "MobileViTV2ForSemanticSegmentation"),940        ("segformer", "SegformerForSemanticSegmentation"),941        ("upernet", "UperNetForSemanticSegmentation"),942    ]943)944 945MODEL_FOR_INSTANCE_SEGMENTATION_MAPPING_NAMES = OrderedDict(946    [947        # Model for Instance Segmentation mapping948        # MaskFormerForInstanceSegmentation can be removed from this mapping in v5949        ("maskformer", "MaskFormerForInstanceSegmentation"),950    ]951)952 953MODEL_FOR_UNIVERSAL_SEGMENTATION_MAPPING_NAMES = OrderedDict(954    [955        # Model for Universal Segmentation mapping956        ("detr", "DetrForSegmentation"),957        ("eomt", "EomtForUniversalSegmentation"),958        ("mask2former", "Mask2FormerForUniversalSegmentation"),959        ("maskformer", "MaskFormerForInstanceSegmentation"),960        ("oneformer", "OneFormerForUniversalSegmentation"),961    ]962)963 964MODEL_FOR_VIDEO_CLASSIFICATION_MAPPING_NAMES = OrderedDict(965    [966        ("timesformer", "TimesformerForVideoClassification"),967        ("videomae", "VideoMAEForVideoClassification"),968        ("vivit", "VivitForVideoClassification"),969        ("vjepa2", "VJEPA2ForVideoClassification"),970    ]971)972 973MODEL_FOR_VISION_2_SEQ_MAPPING_NAMES = OrderedDict(974    [975        ("blip", "BlipForConditionalGeneration"),976        ("blip-2", "Blip2ForConditionalGeneration"),977        ("chameleon", "ChameleonForConditionalGeneration"),978        ("git", "GitForCausalLM"),979        ("idefics2", "Idefics2ForConditionalGeneration"),980        ("idefics3", "Idefics3ForConditionalGeneration"),981        ("instructblip", "InstructBlipForConditionalGeneration"),982        ("instructblipvideo", "InstructBlipVideoForConditionalGeneration"),983        ("kosmos-2", "Kosmos2ForConditionalGeneration"),984        ("kosmos-2.5", "Kosmos2_5ForConditionalGeneration"),985        ("llava", "LlavaForConditionalGeneration"),986        ("llava_next", "LlavaNextForConditionalGeneration"),987        ("llava_next_video", "LlavaNextVideoForConditionalGeneration"),988        ("llava_onevision", "LlavaOnevisionForConditionalGeneration"),989        ("mistral3", "Mistral3ForConditionalGeneration"),990        ("mllama", "MllamaForConditionalGeneration"),991        ("ovis2", "Ovis2ForConditionalGeneration"),992        ("paligemma", "PaliGemmaForConditionalGeneration"),993        ("pix2struct", "Pix2StructForConditionalGeneration"),994        ("qwen2_5_vl", "Qwen2_5_VLForConditionalGeneration"),995        ("qwen2_vl", "Qwen2VLForConditionalGeneration"),996        ("qwen3_vl", "Qwen3VLForConditionalGeneration"),997        ("qwen3_vl_moe", "Qwen3VLMoeForConditionalGeneration"),998        ("video_llava", "VideoLlavaForConditionalGeneration"),999        ("vipllava", "VipLlavaForConditionalGeneration"),1000        ("vision-encoder-decoder", "VisionEncoderDecoderModel"),1001    ]1002)1003 1004MODEL_FOR_RETRIEVAL_MAPPING_NAMES = OrderedDict(1005    [1006        ("colpali", "ColPaliForRetrieval"),1007    ]1008)1009 1010MODEL_FOR_IMAGE_TEXT_TO_TEXT_MAPPING_NAMES = OrderedDict(1011    [1012        ("aria", "AriaForConditionalGeneration"),1013        ("aya_vision", "AyaVisionForConditionalGeneration"),1014        ("blip", "BlipForConditionalGeneration"),1015        ("blip-2", "Blip2ForConditionalGeneration"),1016        ("chameleon", "ChameleonForConditionalGeneration"),1017        ("cohere2_vision", "Cohere2VisionForConditionalGeneration"),1018        ("deepseek_vl", "DeepseekVLForConditionalGeneration"),1019        ("deepseek_vl_hybrid", "DeepseekVLHybridForConditionalGeneration"),1020        ("emu3", "Emu3ForConditionalGeneration"),1021        ("evolla", "EvollaForProteinText2Text"),1022        ("florence2", "Florence2ForConditionalGeneration"),1023        ("fuyu", "FuyuForCausalLM"),1024        ("gemma3", "Gemma3ForConditionalGeneration"),1025        ("gemma3n", "Gemma3nForConditionalGeneration"),1026        ("git", "GitForCausalLM"),1027        ("glm4v", "Glm4vForConditionalGeneration"),1028        ("glm4v_moe", "Glm4vMoeForConditionalGeneration"),1029        ("got_ocr2", "GotOcr2ForConditionalGeneration"),1030        ("idefics", "IdeficsForVisionText2Text"),1031        ("idefics2", "Idefics2ForConditionalGeneration"),1032        ("idefics3", "Idefics3ForConditionalGeneration"),1033        ("instructblip", "InstructBlipForConditionalGeneration"),1034        ("internvl", "InternVLForConditionalGeneration"),1035        ("janus", "JanusForConditionalGeneration"),1036        ("kosmos-2", "Kosmos2ForConditionalGeneration"),1037        ("kosmos-2.5", "Kosmos2_5ForConditionalGeneration"),1038        ("lfm2_vl", "Lfm2VlForConditionalGeneration"),1039        ("llama4", "Llama4ForConditionalGeneration"),1040        ("llava", "LlavaForConditionalGeneration"),1041        ("llava_next", "LlavaNextForConditionalGeneration"),1042        ("llava_next_video", "LlavaNextVideoForConditionalGeneration"),1043        ("llava_onevision", "LlavaOnevisionForConditionalGeneration"),1044        ("mistral3", "Mistral3ForConditionalGeneration"),1045        ("mllama", "MllamaForConditionalGeneration"),1046        ("ovis2", "Ovis2ForConditionalGeneration"),1047        ("paligemma", "PaliGemmaForConditionalGeneration"),1048        ("perception_lm", "PerceptionLMForConditionalGeneration"),1049        ("pix2struct", "Pix2StructForConditionalGeneration"),1050        ("pixtral", "LlavaForConditionalGeneration"),1051        ("qwen2_5_vl", "Qwen2_5_VLForConditionalGeneration"),1052        ("qwen2_vl", "Qwen2VLForConditionalGeneration"),1053        ("qwen3_vl", "Qwen3VLForConditionalGeneration"),1054        ("qwen3_vl_moe", "Qwen3VLMoeForConditionalGeneration"),1055        ("shieldgemma2", "Gemma3ForConditionalGeneration"),1056        ("smolvlm", "SmolVLMForConditionalGeneration"),1057        ("udop", "UdopForConditionalGeneration"),1058        ("vipllava", "VipLlavaForConditionalGeneration"),1059        ("vision-encoder-decoder", "VisionEncoderDecoderModel"),1060    ]1061)1062 1063MODEL_FOR_MASKED_LM_MAPPING_NAMES = OrderedDict(1064    [1065        # Model for Masked LM mapping1066        ("albert", "AlbertForMaskedLM"),1067        ("bart", "BartForConditionalGeneration"),1068        ("bert", "BertForMaskedLM"),1069        ("big_bird", "BigBirdForMaskedLM"),1070        ("camembert", "CamembertForMaskedLM"),1071        ("convbert", "ConvBertForMaskedLM"),1072        ("data2vec-text", "Data2VecTextForMaskedLM"),1073        ("deberta", "DebertaForMaskedLM"),1074        ("deberta-v2", "DebertaV2ForMaskedLM"),1075        ("distilbert", "DistilBertForMaskedLM"),1076        ("electra", "ElectraForMaskedLM"),1077        ("ernie", "ErnieForMaskedLM"),1078        ("esm", "EsmForMaskedLM"),1079        ("flaubert", "FlaubertWithLMHeadModel"),1080        ("fnet", "FNetForMaskedLM"),1081        ("funnel", "FunnelForMaskedLM"),1082        ("ibert", "IBertForMaskedLM"),1083        ("layoutlm", "LayoutLMForMaskedLM"),1084        ("longformer", "LongformerForMaskedLM"),1085        ("luke", "LukeForMaskedLM"),1086        ("mbart", "MBartForConditionalGeneration"),1087        ("mega", "MegaForMaskedLM"),1088        ("megatron-bert", "MegatronBertForMaskedLM"),1089        ("mobilebert", "MobileBertForMaskedLM"),1090        ("modernbert", "ModernBertForMaskedLM"),1091        ("mpnet", "MPNetForMaskedLM"),1092        ("mra", "MraForMaskedLM"),1093        ("mvp", "MvpForConditionalGeneration"),1094        ("nezha", "NezhaForMaskedLM"),1095        ("nystromformer", "NystromformerForMaskedLM"),1096        ("perceiver", "PerceiverForMaskedLM"),1097        ("qdqbert", "QDQBertForMaskedLM"),1098        ("reformer", "ReformerForMaskedLM"),1099        ("rembert", "RemBertForMaskedLM"),1100        ("roberta", "RobertaForMaskedLM"),1101        ("roberta-prelayernorm", "RobertaPreLayerNormForMaskedLM"),1102        ("roc_bert", "RoCBertForMaskedLM"),1103        ("roformer", "RoFormerForMaskedLM"),1104        ("squeezebert", "SqueezeBertForMaskedLM"),1105        ("tapas", "TapasForMaskedLM"),1106        ("wav2vec2", "Wav2Vec2ForMaskedLM"),1107        ("xlm", "XLMWithLMHeadModel"),1108        ("xlm-roberta", "XLMRobertaForMaskedLM"),1109        ("xlm-roberta-xl", "XLMRobertaXLForMaskedLM"),1110        ("xmod", "XmodForMaskedLM"),1111        ("yoso", "YosoForMaskedLM"),1112    ]1113)1114 1115MODEL_FOR_OBJECT_DETECTION_MAPPING_NAMES = OrderedDict(1116    [1117        # Model for Object Detection mapping1118        ("conditional_detr", "ConditionalDetrForObjectDetection"),1119        ("d_fine", "DFineForObjectDetection"),1120        ("dab-detr", "DabDetrForObjectDetection"),1121        ("deformable_detr", "DeformableDetrForObjectDetection"),1122        ("deta", "DetaForObjectDetection"),1123        ("detr", "DetrForObjectDetection"),1124        ("rt_detr", "RTDetrForObjectDetection"),1125        ("rt_detr_v2", "RTDetrV2ForObjectDetection"),1126        ("table-transformer", "TableTransformerForObjectDetection"),1127        ("yolos", "YolosForObjectDetection"),1128    ]1129)1130 1131MODEL_FOR_ZERO_SHOT_OBJECT_DETECTION_MAPPING_NAMES = OrderedDict(1132    [1133        # Model for Zero Shot Object Detection mapping1134        ("grounding-dino", "GroundingDinoForObjectDetection"),1135        ("mm-grounding-dino", "MMGroundingDinoForObjectDetection"),1136        ("omdet-turbo", "OmDetTurboForObjectDetection"),1137        ("owlv2", "Owlv2ForObjectDetection"),1138        ("owlvit", "OwlViTForObjectDetection"),1139    ]1140)1141 1142MODEL_FOR_DEPTH_ESTIMATION_MAPPING_NAMES = OrderedDict(1143    [1144        # Model for depth estimation mapping1145        ("depth_anything", "DepthAnythingForDepthEstimation"),1146        ("depth_pro", "DepthProForDepthEstimation"),1147        ("dpt", "DPTForDepthEstimation"),1148        ("glpn", "GLPNForDepthEstimation"),1149        ("prompt_depth_anything", "PromptDepthAnythingForDepthEstimation"),1150        ("zoedepth", "ZoeDepthForDepthEstimation"),1151    ]1152)1153MODEL_FOR_SEQ_TO_SEQ_CAUSAL_LM_MAPPING_NAMES = OrderedDict(1154    [1155        # Model for Seq2Seq Causal LM mapping1156        ("bart", "BartForConditionalGeneration"),1157        ("bigbird_pegasus", "BigBirdPegasusForConditionalGeneration"),1158        ("blenderbot", "BlenderbotForConditionalGeneration"),1159        ("blenderbot-small", "BlenderbotSmallForConditionalGeneration"),1160        ("encoder-decoder", "EncoderDecoderModel"),1161        ("fsmt", "FSMTForConditionalGeneration"),1162        ("gptsan-japanese", "GPTSanJapaneseForConditionalGeneration"),1163        ("granite_speech", "GraniteSpeechForConditionalGeneration"),1164        ("led", "LEDForConditionalGeneration"),1165        ("longt5", "LongT5ForConditionalGeneration"),1166        ("m2m_100", "M2M100ForConditionalGeneration"),1167        ("marian", "MarianMTModel"),1168        ("mbart", "MBartForConditionalGeneration"),1169        ("mt5", "MT5ForConditionalGeneration"),1170        ("mvp", "MvpForConditionalGeneration"),1171        ("nllb-moe", "NllbMoeForConditionalGeneration"),1172        ("pegasus", "PegasusForConditionalGeneration"),1173        ("pegasus_x", "PegasusXForConditionalGeneration"),1174        ("plbart", "PLBartForConditionalGeneration"),1175        ("prophetnet", "ProphetNetForConditionalGeneration"),1176        ("qwen2_audio", "Qwen2AudioForConditionalGeneration"),1177        ("seamless_m4t", "SeamlessM4TForTextToText"),1178        ("seamless_m4t_v2", "SeamlessM4Tv2ForTextToText"),1179        ("switch_transformers", "SwitchTransformersForConditionalGeneration"),1180        ("t5", "T5ForConditionalGeneration"),1181        ("t5gemma", "T5GemmaForConditionalGeneration"),1182        ("umt5", "UMT5ForConditionalGeneration"),1183        ("voxtral", "VoxtralForConditionalGeneration"),1184        ("xlm-prophetnet", "XLMProphetNetForConditionalGeneration"),1185    ]1186)1187 1188MODEL_FOR_SPEECH_SEQ_2_SEQ_MAPPING_NAMES = OrderedDict(1189    [1190        ("dia", "DiaForConditionalGeneration"),1191        ("granite_speech", "GraniteSpeechForConditionalGeneration"),1192        ("kyutai_speech_to_text", "KyutaiSpeechToTextForConditionalGeneration"),1193        ("moonshine", "MoonshineForConditionalGeneration"),1194        ("pop2piano", "Pop2PianoForConditionalGeneration"),1195        ("seamless_m4t", "SeamlessM4TForSpeechToText"),1196        ("seamless_m4t_v2", "SeamlessM4Tv2ForSpeechToText"),1197        ("speech-encoder-decoder", "SpeechEncoderDecoderModel"),1198        ("speech_to_text", "Speech2TextForConditionalGeneration"),1199        ("speecht5", "SpeechT5ForSpeechToText"),1200        ("whisper", "WhisperForConditionalGeneration"),

Showing the first 1,200 of 2383 lines. Download the file for the rest.

Aluode/PerceptionLabPortable · CoolFace