CoolFace
Modelpublic

ncbateman/nansen-docker

sourceHugging Facellama3.2updated 2y agoView on Hugging Face
0likes4downloads
config.json55 linesDownload Raw Back to root
1{2  "_attn_implementation_autoset": true,3  "_name_or_path": "unsloth/Llama-3.2-1B-Instruct",4  "architectures": [5    "LlamaForCausalLM"6  ],7  "attention_bias": false,8  "attention_dropout": 0.0,9  "bos_token_id": 128000,10  "eos_token_id": 128009,11  "head_dim": 64,12  "hidden_act": "silu",13  "hidden_size": 2048,14  "initializer_range": 0.02,15  "intermediate_size": 8192,16  "max_position_embeddings": 131072,17  "mlp_bias": false,18  "model_type": "llama",19  "num_attention_heads": 32,20  "num_hidden_layers": 16,21  "num_key_value_heads": 8,22  "pad_token_id": 128004,23  "pretraining_tp": 1,24  "quantization_config": {25    "_load_in_4bit": false,26    "_load_in_8bit": true,27    "bnb_4bit_compute_dtype": "float32",28    "bnb_4bit_quant_storage": "uint8",29    "bnb_4bit_quant_type": "fp4",30    "bnb_4bit_use_double_quant": false,31    "llm_int8_enable_fp32_cpu_offload": false,32    "llm_int8_has_fp16_weight": false,33    "llm_int8_skip_modules": null,34    "llm_int8_threshold": 6.0,35    "load_in_4bit": false,36    "load_in_8bit": true,37    "quant_method": "bitsandbytes"38  },39  "rms_norm_eps": 1e-05,40  "rope_scaling": {41    "factor": 32.0,42    "high_freq_factor": 4.0,43    "low_freq_factor": 1.0,44    "original_max_position_embeddings": 8192,45    "rope_type": "llama3"46  },47  "rope_theta": 500000.0,48  "tie_word_embeddings": true,49  "torch_dtype": "bfloat16",50  "transformers_version": "4.46.1",51  "unsloth_fixed": true,52  "use_cache": false,53  "vocab_size": 12825654}55