nm-testing/kv_cache_gptq_tinyllama-e2e
0395
1{2 "architectures": [3 "LlamaForCausalLM"4 ],5 "attention_bias": false,6 "bos_token_id": 1,7 "eos_token_id": 2,8 "hidden_act": "silu",9 "hidden_size": 2048,10 "initializer_range": 0.02,11 "intermediate_size": 5632,12 "max_position_embeddings": 2048,13 "model_type": "llama",14 "num_attention_heads": 32,15 "num_hidden_layers": 22,16 "num_key_value_heads": 4,17 "pretraining_tp": 1,18 "quantization_config": {19 "config_groups": {20 "group_0": {21 "format": "pack-quantized",22 "input_activations": null,23 "output_activations": null,24 "targets": [25 "Linear"26 ],27 "weights": {28 "actorder": null,29 "block_structure": null,30 "dynamic": false,31 "group_size": null,32 "num_bits": 4,33 "observer": "memoryless_minmax",34 "observer_kwargs": {},35 "scale_dtype": null,36 "strategy": "channel",37 "symmetric": true,38 "type": "int",39 "zp_dtype": null40 }41 }42 },43 "format": "pack-quantized",44 "global_compression_ratio": null,45 "ignore": [46 "lm_head"47 ],48 "kv_cache_scheme": {49 "actorder": null,50 "block_structure": null,51 "dynamic": false,52 "group_size": null,53 "num_bits": 8,54 "observer": null,55 "observer_kwargs": {},56 "scale_dtype": null,57 "strategy": "tensor",58 "symmetric": true,59 "type": "float",60 "zp_dtype": null61 },62 "quant_method": "compressed-tensors",63 "quantization_status": "compressed",64 "sparsity_config": {},65 "transform_config": {},66 "version": "0.19.1a20260919"67 },68 "rms_norm_eps": 1e-05,69 "rope_scaling": null,70 "rope_theta": 10000.0,71 "tie_word_embeddings": false,72 "torch_dtype": "bfloat16",73 "transformers_version": "4.35.0",74 "use_cache": true,75 "vocab_size": 3200076}