RedHatAI/Mistral-Nemo-Instruct-2407-quantized.w8a16
0115
1{2 "_name_or_path": "/network/alexandre/models/mistralai__Mistral-Nemo-Instruct-2407",3 "architectures": [4 "MistralForCausalLM"5 ],6 "attention_dropout": 0.0,7 "bos_token_id": 1,8 "eos_token_id": 2,9 "head_dim": 128,10 "hidden_act": "silu",11 "hidden_size": 5120,12 "initializer_range": 0.02,13 "intermediate_size": 14336,14 "max_position_embeddings": 1024000,15 "model_type": "mistral",16 "num_attention_heads": 32,17 "num_hidden_layers": 40,18 "num_key_value_heads": 8,19 "rms_norm_eps": 1e-05,20 "rope_theta": 1000000.0,21 "sliding_window": null,22 "tie_word_embeddings": false,23 "torch_dtype": "bfloat16",24 "transformers_version": "4.43.0.dev0",25 "use_cache": true,26 "vocab_size": 131072,27 "quantization_config": {28 "config_groups": {29 "group_0": {30 "input_activations": null,31 "output_activations": null,32 "targets": [33 "Linear"34 ],35 "weights": {36 "block_structure": null,37 "dynamic": false,38 "group_size": null,39 "num_bits": 8,40 "observer": "minmax",41 "observer_kwargs": {},42 "strategy": "channel",43 "symmetric": true,44 "type": "int"45 }46 }47 },48 "format": "pack-quantized",49 "global_compression_ratio": 1.4619965155281183,50 "ignore": [51 "lm_head"52 ],53 "kv_cache_scheme": null,54 "quant_method": "compressed-tensors",55 "quantization_status": "compressed",56 "sparsity_config": {}57 }58}59 