nm-testing/fp8_weight_only_tensor-e2e
0237
1{2 "architectures": [3 "LlamaForCausalLM"4 ],5 "attention_bias": false,6 "bos_token_id": 1,7 "eos_token_id": 2,8 "hidden_act": "silu",9 "hidden_size": 2048,10 "initializer_range": 0.02,11 "intermediate_size": 5632,12 "max_position_embeddings": 2048,13 "model_type": "llama",14 "num_attention_heads": 32,15 "num_hidden_layers": 22,16 "num_key_value_heads": 4,17 "pretraining_tp": 1,18 "quantization_config": {19 "config_groups": {20 "group_0": {21 "format": "naive-quantized",22 "input_activations": null,23 "output_activations": null,24 "targets": [25 "Linear"26 ],27 "weights": {28 "actorder": null,29 "block_structure": null,30 "dynamic": false,31 "group_size": null,32 "num_bits": 8,33 "observer": "memoryless_minmax",34 "observer_kwargs": {},35 "scale_dtype": null,36 "strategy": "tensor",37 "symmetric": true,38 "type": "float",39 "zp_dtype": null40 }41 }42 },43 "format": "naive-quantized",44 "global_compression_ratio": null,45 "ignore": [46 "lm_head"47 ],48 "kv_cache_scheme": null,49 "quant_method": "compressed-tensors",50 "quantization_status": "compressed",51 "sparsity_config": {},52 "transform_config": {},53 "version": "0.19.1a20260925"54 },55 "rms_norm_eps": 1e-05,56 "rope_scaling": null,57 "rope_theta": 10000.0,58 "tie_word_embeddings": false,59 "torch_dtype": "bfloat16",60 "transformers_version": "4.35.0",61 "use_cache": true,62 "vocab_size": 3200063}