QuantTrio/KAT-Dev-GPTQ-Int4
192
1{2 "architectures": [3 "Qwen3ForCausalLM"4 ],5 "attention_bias": false,6 "attention_dropout": 0.0,7 "dtype": "bfloat16",8 "eos_token_id": 151645,9 "head_dim": 128,10 "hidden_act": "silu",11 "hidden_size": 5120,12 "initializer_range": 0.02,13 "intermediate_size": 25600,14 "layer_types": [15 "full_attention",16 "full_attention",17 "full_attention",18 "full_attention",19 "full_attention",20 "full_attention",21 "full_attention",22 "full_attention",23 "full_attention",24 "full_attention",25 "full_attention",26 "full_attention",27 "full_attention",28 "full_attention",29 "full_attention",30 "full_attention",31 "full_attention",32 "full_attention",33 "full_attention",34 "full_attention",35 "full_attention",36 "full_attention",37 "full_attention",38 "full_attention",39 "full_attention",40 "full_attention",41 "full_attention",42 "full_attention",43 "full_attention",44 "full_attention",45 "full_attention",46 "full_attention",47 "full_attention",48 "full_attention",49 "full_attention",50 "full_attention",51 "full_attention",52 "full_attention",53 "full_attention",54 "full_attention",55 "full_attention",56 "full_attention",57 "full_attention",58 "full_attention",59 "full_attention",60 "full_attention",61 "full_attention",62 "full_attention",63 "full_attention",64 "full_attention",65 "full_attention",66 "full_attention",67 "full_attention",68 "full_attention",69 "full_attention",70 "full_attention",71 "full_attention",72 "full_attention",73 "full_attention",74 "full_attention",75 "full_attention",76 "full_attention",77 "full_attention",78 "full_attention"79 ],80 "max_position_embeddings": 131072,81 "max_window_layers": 64,82 "model_type": "qwen3",83 "num_attention_heads": 64,84 "num_hidden_layers": 64,85 "num_key_value_heads": 8,86 "pad_token_id": 151643,87 "quantization_config": {88 "bits": 4,89 "checkpoint_format": "gptq",90 "desc_act": false,91 "group_size": 128,92 "lm_head": false,93 "meta": {94 "act_group_aware": false,95 "damp_auto_increment": 0.01,96 "damp_percent": 0.05,97 "mse": 0.0,98 "quantizer": [99 "gptqmodel:4.2.5"100 ],101 "static_groups": false,102 "true_sequential": true,103 "uri": "https://github.com/modelcloud/gptqmodel",104 "v2": false,105 "v2_alpha": 0.25106 },107 "pack_dtype": "int32",108 "quant_method": "gptq",109 "sym": true110 },111 "rms_norm_eps": 1e-06,112 "rope_scaling": null,113 "rope_theta": 1000000,114 "sliding_window": null,115 "tie_word_embeddings": false,116 "transformers_version": "4.56.2",117 "use_cache": false,118 "use_sliding_window": false,119 "vocab_size": 151936120}121 