xdecoder/Instruct-X-Decoder
163
1# --------------------------------------------------------2# X-Decoder -- Generalized Decoding for Pixel, Image, and Language3# Copyright (c) 2022 Microsoft4# Licensed under The MIT License [see LICENSE for details]5# Written by Xueyan Zou (xueyan@cs.wisc.edu)6# --------------------------------------------------------7 8##################9# Task settings10##################11VERBOSE: true12MODEL:13 NAME: xdecoder_model14 HEAD: xdecoder_head15 DIM_PROJ: 51216 BACKBONE_DIM: 76817 TEXT:18 ARCH: vlpencoder19 NAME: transformer20 TOKENIZER: clip21 CONTEXT_LENGTH: 77 # 7722 WIDTH: 51223 HEADS: 824 LAYERS: 12 # 625 AUTOGRESSIVE: True26 BACKBONE:27 NAME: focal_dw28 PRETRAINED: ''29 LOAD_PRETRAINED: false30 FOCAL:31 PRETRAIN_IMG_SIZE: 22432 PATCH_SIZE: 433 EMBED_DIM: 9634 DEPTHS: [2, 2, 6, 2]35 FOCAL_LEVELS: [3, 3, 3, 3]36 FOCAL_WINDOWS: [3, 3, 3, 3]37 DROP_PATH_RATE: 0.338 MLP_RATIO: 4.039 DROP_RATE: 0.040 PATCH_NORM: True41 USE_CONV_EMBED: True42 SCALING_MODULATOR: True43 USE_CHECKPOINT: False44 USE_POSTLN: true45 USE_POSTLN_IN_MODULATION: false46 USE_LAYERSCALE: True47 OUT_FEATURES: ["res2", "res3", "res4", "res5"]48 OUT_INDICES: [0, 1, 2, 3]49 ENCODER:50 NAME: transformer_encoder_fpn51 IGNORE_VALUE: 25552 NUM_CLASSES: 13353 LOSS_WEIGHT: 1.054 CONVS_DIM: 51255 MASK_DIM: 51256 NORM: "GN"57 IN_FEATURES: ["res2", "res3", "res4", "res5"]58 DEFORMABLE_TRANSFORMER_ENCODER_IN_FEATURES: ["res3", "res4", "res5"]59 COMMON_STRIDE: 460 TRANSFORMER_ENC_LAYERS: 661 DECODER:62 NAME: xdecoder63 TRANSFORMER_IN_FEATURE: "multi_scale_pixel_decoder"64 MASK: True65 GROUNDING:66 ENABLED: True67 MAX_LEN: 568 TEXT_WEIGHT: 2.069 CLASS_WEIGHT: 0.570 DETECTION: False71 CAPTION:72 ENABLED: True73 PHRASE_PROB: 0.074 SIM_THRES: 0.9575 CAPTIONING:76 ENABLED: True77 STEP: 5078 RETRIEVAL:79 ENABLED: True80 DIM_IMG: 76881 ENSEMBLE: True82 HIDDEN_DIM: 51283 NUM_OBJECT_QUERIES: 10184 NHEADS: 885 DROPOUT: 0.086 DIM_FEEDFORWARD: 204887 PRE_NORM: False88 ENFORCE_INPUT_PROJ: False89 SIZE_DIVISIBILITY: 3290 TRAIN_NUM_POINTS: 1254491 OVERSAMPLE_RATIO: 3.092 IMPORTANCE_SAMPLE_RATIO: 0.7593 DEC_LAYERS: 10 # 9 decoder layers, add one for the loss on learnable query94 TOP_GROUNDING_LAYERS: 395 TOP_CAPTION_LAYERS: 396 TOP_CAPTIONING_LAYERS: 397 TOP_RETRIEVAL_LAYERS: 398 TOP_OPENIMAGE_LAYERS: 1099 TEST:100 SEMANTIC_ON: True101 INSTANCE_ON: True102 PANOPTIC_ON: True103 OVERLAP_THRESHOLD: 0.8104 OBJECT_MASK_THRESHOLD: 0.4105 SEM_SEG_POSTPROCESSING_BEFORE_INFERENCE: false106 DETECTIONS_PER_IMAGE: 100107 108INPUT:109 PIXEL_MEAN: [123.675, 116.280, 103.530]110 PIXEL_STD: [58.395, 57.120, 57.375]