CoolFace
Apppublic

xdecoder/Instruct-X-Decoder

sourceHugging Faceafl-3.0updated 3y agoView on Hugging Face
163likes
svlp_focalt_lang.yaml110 linesDownload Raw Back to xdecoder
1# --------------------------------------------------------2# X-Decoder -- Generalized Decoding for Pixel, Image, and Language3# Copyright (c) 2022 Microsoft4# Licensed under The MIT License [see LICENSE for details]5# Written by Xueyan Zou (xueyan@cs.wisc.edu)6# --------------------------------------------------------7 8##################9# Task settings10##################11VERBOSE: true12MODEL:13  NAME: xdecoder_model14  HEAD: xdecoder_head15  DIM_PROJ: 51216  BACKBONE_DIM: 76817  TEXT:18    ARCH: vlpencoder19    NAME: transformer20    TOKENIZER: clip21    CONTEXT_LENGTH: 77 # 7722    WIDTH: 51223    HEADS: 824    LAYERS: 12 # 625    AUTOGRESSIVE: True26  BACKBONE:27    NAME: focal_dw28    PRETRAINED: ''29    LOAD_PRETRAINED: false30    FOCAL:31      PRETRAIN_IMG_SIZE: 22432      PATCH_SIZE: 433      EMBED_DIM: 9634      DEPTHS: [2, 2, 6, 2]35      FOCAL_LEVELS: [3, 3, 3, 3]36      FOCAL_WINDOWS: [3, 3, 3, 3]37      DROP_PATH_RATE: 0.338      MLP_RATIO: 4.039      DROP_RATE: 0.040      PATCH_NORM: True41      USE_CONV_EMBED: True42      SCALING_MODULATOR: True43      USE_CHECKPOINT: False44      USE_POSTLN: true45      USE_POSTLN_IN_MODULATION: false46      USE_LAYERSCALE: True47      OUT_FEATURES: ["res2", "res3", "res4", "res5"]48      OUT_INDICES: [0, 1, 2, 3]49  ENCODER:50    NAME: transformer_encoder_fpn51    IGNORE_VALUE: 25552    NUM_CLASSES: 13353    LOSS_WEIGHT: 1.054    CONVS_DIM: 51255    MASK_DIM: 51256    NORM: "GN"57    IN_FEATURES: ["res2", "res3", "res4", "res5"]58    DEFORMABLE_TRANSFORMER_ENCODER_IN_FEATURES: ["res3", "res4", "res5"]59    COMMON_STRIDE: 460    TRANSFORMER_ENC_LAYERS: 661  DECODER:62    NAME: xdecoder63    TRANSFORMER_IN_FEATURE: "multi_scale_pixel_decoder"64    MASK: True65    GROUNDING:66      ENABLED: True67      MAX_LEN: 568      TEXT_WEIGHT: 2.069      CLASS_WEIGHT: 0.570    DETECTION: False71    CAPTION:72      ENABLED: True73      PHRASE_PROB: 0.074      SIM_THRES: 0.9575    CAPTIONING:76      ENABLED: True77      STEP: 5078    RETRIEVAL:79      ENABLED: True80      DIM_IMG: 76881      ENSEMBLE: True82    HIDDEN_DIM: 51283    NUM_OBJECT_QUERIES: 10184    NHEADS: 885    DROPOUT: 0.086    DIM_FEEDFORWARD: 204887    PRE_NORM: False88    ENFORCE_INPUT_PROJ: False89    SIZE_DIVISIBILITY: 3290    TRAIN_NUM_POINTS: 1254491    OVERSAMPLE_RATIO: 3.092    IMPORTANCE_SAMPLE_RATIO: 0.7593    DEC_LAYERS: 10  # 9 decoder layers, add one for the loss on learnable query94    TOP_GROUNDING_LAYERS: 395    TOP_CAPTION_LAYERS: 396    TOP_CAPTIONING_LAYERS: 397    TOP_RETRIEVAL_LAYERS: 398    TOP_OPENIMAGE_LAYERS: 1099    TEST:100      SEMANTIC_ON: True101      INSTANCE_ON: True102      PANOPTIC_ON: True103      OVERLAP_THRESHOLD: 0.8104      OBJECT_MASK_THRESHOLD: 0.4105      SEM_SEG_POSTPROCESSING_BEFORE_INFERENCE: false106      DETECTIONS_PER_IMAGE: 100107 108INPUT:109  PIXEL_MEAN: [123.675, 116.280, 103.530]110  PIXEL_STD: [58.395, 57.120, 57.375]