TaylorAI/Flash-Llama-7B
168
1{2 "_name_or_path": "togethercomputer/LLaMA-2-7B-32K",3 "architectures": [4 "LlamaForCausalLM"5 ],6 "auto_map": {7 "AutoModelForCausalLM": "modeling_flash_llama.LlamaForCausalLM"8 },9 "bos_token_id": 1,10 "eos_token_id": 2,11 "hidden_act": "silu",12 "hidden_size": 4096,13 "initializer_range": 0.02,14 "intermediate_size": 11008,15 "max_position_embeddings": 32768,16 "model_type": "llama",17 "num_attention_heads": 32,18 "num_hidden_layers": 32,19 "num_key_value_heads": 32,20 "pad_token_id": 0,21 "pretraining_tp": 1,22 "rms_norm_eps": 1e-05,23 "rope_scaling": null,24 "tie_word_embeddings": false,25 "torch_dtype": "float16",26 "transformers_version": "4.31.0",27 "use_cache": true,28 "vocab_size": 3200029}30 