nm-testing/kv_cache_fp8-e2e
0386
1{2 "architectures": [3 "LlamaForCausalLM"4 ],5 "attention_bias": false,6 "bos_token_id": 1,7 "eos_token_id": 2,8 "hidden_act": "silu",9 "hidden_size": 2048,10 "initializer_range": 0.02,11 "intermediate_size": 5632,12 "max_position_embeddings": 2048,13 "model_type": "llama",14 "num_attention_heads": 32,15 "num_hidden_layers": 22,16 "num_key_value_heads": 4,17 "pretraining_tp": 1,18 "quantization_config": {19 "config_groups": {},20 "format": "dense",21 "global_compression_ratio": null,22 "ignore": [],23 "kv_cache_scheme": {24 "actorder": null,25 "block_structure": null,26 "dynamic": false,27 "group_size": null,28 "num_bits": 8,29 "observer": null,30 "observer_kwargs": {},31 "scale_dtype": null,32 "strategy": "tensor",33 "symmetric": true,34 "type": "float",35 "zp_dtype": null36 },37 "quant_method": "compressed-tensors",38 "quantization_status": "compressed",39 "sparsity_config": {},40 "transform_config": {},41 "version": "0.19.1a20260919"42 },43 "rms_norm_eps": 1e-05,44 "rope_scaling": null,45 "rope_theta": 10000.0,46 "tie_word_embeddings": false,47 "torch_dtype": "bfloat16",48 "transformers_version": "4.35.0",49 "use_cache": true,50 "vocab_size": 3200051}