CoolFace
Modelpublic

Felipe97/llama-cpp-compiled

sourceHugging Faceupdated 3d agoView on Hugging Face
0likes1.1kdownloads
llama-arch.h798 linesDownload Raw Back to src
1#pragma once2 3#include "ggml.h" // ggml_op4 5#include <string>6#include <set>7#include <vector>8 9//10// gguf constants (sync with gguf.py)11//12 13enum llm_arch {14    LLM_ARCH_CLIP,15    LLM_ARCH_LLAMA,16    LLM_ARCH_LLAMA4,17    LLM_ARCH_DECI,18    LLM_ARCH_FALCON,19    LLM_ARCH_BAICHUAN,20    LLM_ARCH_GROK,21    LLM_ARCH_GPT2,22    LLM_ARCH_GPTJ,23    LLM_ARCH_GPTNEOX,24    LLM_ARCH_MPT,25    LLM_ARCH_STARCODER,26    LLM_ARCH_REFACT,27    LLM_ARCH_BERT,28    LLM_ARCH_MODERN_BERT,29    LLM_ARCH_NOMIC_BERT,30    LLM_ARCH_NOMIC_BERT_MOE,31    LLM_ARCH_NEO_BERT,32    LLM_ARCH_JINA_BERT_V2,33    LLM_ARCH_JINA_BERT_V3,34    LLM_ARCH_EUROBERT,35    LLM_ARCH_BLOOM,36    LLM_ARCH_STABLELM,37    LLM_ARCH_QWEN,38    LLM_ARCH_QWEN2,39    LLM_ARCH_QWEN2MOE,40    LLM_ARCH_QWEN2VL,41    LLM_ARCH_QWEN3,42    LLM_ARCH_QWEN3MOE,43    LLM_ARCH_QWEN3NEXT,44    LLM_ARCH_QWEN3VL,45    LLM_ARCH_QWEN3VLMOE,46    LLM_ARCH_QWEN35,47    LLM_ARCH_QWEN35MOE,48    LLM_ARCH_QWEN4EXP,49    LLM_ARCH_PHI2,50    LLM_ARCH_PHI3,51    LLM_ARCH_PHIMOE,52    LLM_ARCH_PLAMO,53    LLM_ARCH_PLAMO2,54    LLM_ARCH_PLAMO3,55    LLM_ARCH_CODESHELL,56    LLM_ARCH_ORION,57    LLM_ARCH_INTERNLM2,58    LLM_ARCH_MINICPM,59    LLM_ARCH_MINICPM3,60    LLM_ARCH_GEMMA,61    LLM_ARCH_GEMMA2,62    LLM_ARCH_GEMMA3,63    LLM_ARCH_GEMMA3N,64    LLM_ARCH_GEMMA4,65    LLM_ARCH_GEMMA4_ASSISTANT,66    LLM_ARCH_GEMMA_EMBEDDING,67    LLM_ARCH_STARCODER2,68    LLM_ARCH_MAMBA,69    LLM_ARCH_MAMBA2,70    LLM_ARCH_MAPLE,71    LLM_ARCH_JAMBA,72    LLM_ARCH_FALCON_H1,73    LLM_ARCH_XVERSE,74    LLM_ARCH_COMMAND_R,75    LLM_ARCH_COHERE2,76    LLM_ARCH_COHERE2MOE,77    LLM_ARCH_DBRX,78    LLM_ARCH_OLMO,79    LLM_ARCH_OLMO2,80    LLM_ARCH_OLMOE,81    LLM_ARCH_MUSE_GLIMMER,82    LLM_ARCH_OPENELM,83    LLM_ARCH_ARCTIC,84    LLM_ARCH_DEEPSEEK,85    LLM_ARCH_DEEPSEEK2,86    LLM_ARCH_DEEPSEEK2OCR,87    LLM_ARCH_DEEPSEEK32,88    LLM_ARCH_DEEPSEEK4,89    LLM_ARCH_CHATGLM,90    LLM_ARCH_GLM4,91    LLM_ARCH_GLM4_MOE,92    LLM_ARCH_GLM_DSA,93    LLM_ARCH_BITNET,94    LLM_ARCH_T5,95    LLM_ARCH_T5ENCODER,96    LLM_ARCH_JAIS,97    LLM_ARCH_JAIS2,98    LLM_ARCH_NEMOTRON,99    LLM_ARCH_NEMOTRON_H,100    LLM_ARCH_NEMOTRON_H_MOE,101    LLM_ARCH_EXAONE,102    LLM_ARCH_EXAONE4,103    LLM_ARCH_EXAONE_MOE,104    LLM_ARCH_RWKV6,105    LLM_ARCH_RWKV6QWEN2,106    LLM_ARCH_RWKV7,107    LLM_ARCH_ARWKV7,108    LLM_ARCH_GRANITE,109    LLM_ARCH_GRANITE_MOE,110    LLM_ARCH_GRANITE_HYBRID,111    LLM_ARCH_GRANITE_SWITCH,112    LLM_ARCH_GRANITE_SWA,113    LLM_ARCH_CHAMELEON,114    LLM_ARCH_WAVTOKENIZER_DEC,115    LLM_ARCH_PLM,116    LLM_ARCH_BAILINGMOE,117    LLM_ARCH_BAILINGMOE2,118    LLM_ARCH_BAILINGMOE3,119    LLM_ARCH_DOTS1,120    LLM_ARCH_DOTS3NOTE,121    LLM_ARCH_ARCEE,122    LLM_ARCH_AFMOE,123    LLM_ARCH_LAGUNA,124    LLM_ARCH_ERNIE4_5,125    LLM_ARCH_ERNIE4_5_MOE,126    LLM_ARCH_HUNYUAN_MOE,127    LLM_ARCH_HUNYUAN_DENSE,128    LLM_ARCH_HUNYUAN_VL,129    LLM_ARCH_HY_V3,130    LLM_ARCH_HY_V4,131    LLM_ARCH_SMOLLM3,132    LLM_ARCH_OPENAI_MOE,133    LLM_ARCH_LFM2,134    LLM_ARCH_LFM2MOE,135    LLM_ARCH_DREAM,136    LLM_ARCH_SMALLTHINKER,137    LLM_ARCH_LLADA,138    LLM_ARCH_LLADA_MOE,139    LLM_ARCH_SEED_OSS,140    LLM_ARCH_GROVEMOE,141    LLM_ARCH_APERTUS,142    LLM_ARCH_MINIMAX_M2,143    LLM_ARCH_COGVLM,144    LLM_ARCH_RND1,145    LLM_ARCH_PANGU_EMBED,146    LLM_ARCH_MISTRAL3,147    LLM_ARCH_MISTRAL4,148    LLM_ARCH_PADDLEOCR,149    LLM_ARCH_MIMO2,150    LLM_ARCH_STEP35,151    LLM_ARCH_SPARK2_5,152    LLM_ARCH_LLAMA_EMBED,153    LLM_ARCH_MAINCODER,154    LLM_ARCH_KIMI_LINEAR,155    LLM_ARCH_KIMI_K3,156    LLM_ARCH_TALKIE,157    LLM_ARCH_MELLUM,158    LLM_ARCH_EAGLE3,159    LLM_ARCH_MINIMAX_M3,160    LLM_ARCH_DFLASH,161    LLM_ARCH_NANBEIGE,162    LLM_ARCH_QWEN3TTS,163    LLM_ARCH_POCKETTTS,164    LLM_ARCH_MINIMAX_01,165    LLM_ARCH_HRM_TEXT,166    LLM_ARCH_UNKNOWN,167};168 169enum llm_kv {170    LLM_KV_GENERAL_TYPE,171    LLM_KV_GENERAL_ARCHITECTURE,172    LLM_KV_GENERAL_QUANTIZATION_VERSION,173    LLM_KV_GENERAL_ALIGNMENT,174    LLM_KV_GENERAL_FILE_TYPE,175    LLM_KV_GENERAL_SAMPLING_SEQUENCE,176    LLM_KV_GENERAL_SAMPLING_TOP_K,177    LLM_KV_GENERAL_SAMPLING_TOP_P,178    LLM_KV_GENERAL_SAMPLING_MIN_P,179    LLM_KV_GENERAL_SAMPLING_XTC_PROBABILITY,180    LLM_KV_GENERAL_SAMPLING_XTC_THRESHOLD,181    LLM_KV_GENERAL_SAMPLING_TEMP,182    LLM_KV_GENERAL_SAMPLING_PENALTY_LAST_N,183    LLM_KV_GENERAL_SAMPLING_PENALTY_REPEAT,184    LLM_KV_GENERAL_SAMPLING_MIROSTAT,185    LLM_KV_GENERAL_SAMPLING_MIROSTAT_TAU,186    LLM_KV_GENERAL_SAMPLING_MIROSTAT_ETA,187    LLM_KV_GENERAL_NAME,188    LLM_KV_GENERAL_AUTHOR,189    LLM_KV_GENERAL_VERSION,190    LLM_KV_GENERAL_URL,191    LLM_KV_GENERAL_DESCRIPTION,192    LLM_KV_GENERAL_LICENSE,193    LLM_KV_GENERAL_SOURCE_URL,194    LLM_KV_GENERAL_SOURCE_HF_REPO,195 196    LLM_KV_VOCAB_SIZE,197    LLM_KV_CONTEXT_LENGTH,198    LLM_KV_EMBEDDING_LENGTH,199    LLM_KV_EMBEDDING_LENGTH_OUT,200    LLM_KV_EMBEDDING_LENGTH_PER_LAYER,201    LLM_KV_FEATURES_LENGTH,202    LLM_KV_BLOCK_COUNT,203    LLM_KV_LEADING_DENSE_BLOCK_COUNT,204    LLM_KV_ATTN_RES_BLOCK_SIZE,205    LLM_KV_ACTIVATION_SITU_BETA,206    LLM_KV_ACTIVATION_SITU_LINEAR_BETA,207    LLM_KV_FEED_FORWARD_LENGTH,208    LLM_KV_EXPERT_FEED_FORWARD_LENGTH,209    LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH,210    LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH,211    LLM_KV_SWIGLU_CLAMP_EXP,212    LLM_KV_SWIGLU_CLAMP_SHEXP,213    LLM_KV_USE_PARALLEL_RESIDUAL,214    LLM_KV_TENSOR_DATA_LAYOUT,215    LLM_KV_EXPERT_COUNT,216    LLM_KV_EXPERT_USED_COUNT,217    LLM_KV_EXPERT_SHARED_COUNT,218    LLM_KV_EXPERT_GROUP_COUNT,219    LLM_KV_EXPERT_GROUP_USED_COUNT,220    LLM_KV_EXPERT_WEIGHTS_SCALE,221    LLM_KV_EXPERT_WEIGHTS_NORM,222    LLM_KV_EXPERT_LATENT_LENGTH,223    LLM_KV_EXPERT_GATING_FUNC,224    LLM_KV_EXPERT_GROUP_SCALE,225    LLM_KV_EXPERTS_PER_GROUP,226    LLM_KV_MOE_EVERY_N_LAYERS,227    LLM_KV_MOE_LATENT_SIZE,228    LLM_KV_NEXTN_PREDICT_LAYERS,229    LLM_KV_NUM_DEEPSTACK_LAYERS,230    LLM_KV_DEEPSTACK_MAPPING,231    LLM_KV_HIDDEN_ACT,232    LLM_KV_POOLING_TYPE,233    LLM_KV_LOGIT_SCALE,234    LLM_KV_DECODER_START_TOKEN_ID,235    LLM_KV_DECODER_BLOCK_COUNT,236    LLM_KV_ATTN_LOGIT_SOFTCAPPING,237    LLM_KV_ROUTER_LOGIT_SOFTCAPPING,238    LLM_KV_FINAL_LOGIT_SOFTCAPPING,239    LLM_KV_SWIN_NORM,240    LLM_KV_RESCALE_EVERY_N_LAYERS,241    LLM_KV_TIME_MIX_EXTRA_DIM,242    LLM_KV_TIME_DECAY_EXTRA_DIM,243    LLM_KV_RESIDUAL_SCALE,244    LLM_KV_EMBEDDING_SCALE,245    LLM_KV_ADAPTER_COUNT,246    LLM_KV_ADAPTER_TOKEN_IDS_ACTIVATE,247    LLM_KV_ADAPTER_TOKEN_IDS_SUBSTITUTE,248    LLM_KV_ADAPTER_LORA_RANK,249    LLM_KV_ADAPTER_ROUTER_GAIN,250    LLM_KV_TOKEN_SHIFT_COUNT,251    LLM_KV_INTERLEAVE_MOE_LAYER_STEP,252    LLM_KV_FULL_ATTENTION_INTERVAL,253    LLM_KV_NUM_LOOPS,254    LLM_KV_SKIP_LOOP_FINAL_NORM,255    LLM_KV_HRM_LAYERS_PER_STACK,256    LLM_KV_HRM_H_CYCLES,257    LLM_KV_HRM_L_CYCLES,258    LLM_KV_HRM_PREFIX_LM,259 260    LLM_KV_ATTENTION_HEAD_COUNT,261    LLM_KV_ATTENTION_HEAD_COUNT_KV,262    LLM_KV_ATTENTION_MAX_ALIBI_BIAS,263    LLM_KV_ATTENTION_CLAMP_KQV,264    LLM_KV_ATTENTION_KEY_LENGTH,265    LLM_KV_ATTENTION_VALUE_LENGTH,266    LLM_KV_ATTENTION_LAYERNORM_EPS,267    LLM_KV_ATTENTION_LAYERNORM_RMS_EPS,268    LLM_KV_ATTENTION_GROUPNORM_EPS,269    LLM_KV_ATTENTION_GROUPNORM_GROUPS,270    LLM_KV_ATTENTION_CAUSAL,271    LLM_KV_ATTENTION_Q_LORA_RANK,272    LLM_KV_ATTENTION_KV_LORA_RANK,273    LLM_KV_ATTENTION_DECAY_LORA_RANK,274    LLM_KV_ATTENTION_ICLR_LORA_RANK,275    LLM_KV_ATTENTION_VALUE_RESIDUAL_MIX_LORA_RANK,276    LLM_KV_ATTENTION_GATE_LORA_RANK,277    LLM_KV_ATTENTION_RELATIVE_BUCKETS_COUNT,278    LLM_KV_ATTENTION_SLIDING_WINDOW,279    LLM_KV_ATTENTION_SLIDING_WINDOW_PATTERN,280    LLM_KV_ATTENTION_SCALE,281    LLM_KV_ATTENTION_ROPE_PATTERN,282 283    LLM_KV_ATTENTION_OUTPUT_SCALE,284    LLM_KV_ATTENTION_VALUE_SCALE,285    LLM_KV_ATTENTION_TEMPERATURE_LENGTH,286    LLM_KV_ATTENTION_TEMPERATURE_SCALE,287    LLM_KV_ATTENTION_KEY_LENGTH_MLA,288    LLM_KV_ATTENTION_VALUE_LENGTH_MLA,289    LLM_KV_ATTENTION_KEY_LENGTH_SWA,290    LLM_KV_ATTENTION_VALUE_LENGTH_SWA,291    LLM_KV_ATTENTION_KEY_LENGTH_MLA_SWA,292    LLM_KV_ATTENTION_VALUE_LENGTH_MLA_SWA,293    LLM_KV_ATTENTION_KV_LORA_RANK_SWA,294    LLM_KV_ATTENTION_INDEXER_HEAD_COUNT,295    LLM_KV_ATTENTION_INDEXER_KEY_LENGTH,296    LLM_KV_ATTENTION_INDEXER_TOP_K,297    LLM_KV_ATTENTION_INDEXER_BLOCK_SIZE,298    LLM_KV_ATTENTION_INDEXER_LOCAL_BLOCKS,299    LLM_KV_ATTENTION_INDEXER_TYPES,300    LLM_KV_ATTENTION_OUTPUT_GROUP_COUNT,301    LLM_KV_ATTENTION_OUTPUT_LORA_RANK,302    LLM_KV_ATTENTION_COMPRESS_ROPE_FREQ_BASE,303    LLM_KV_ATTENTION_COMPRESS_RATIOS,304    LLM_KV_ATTENTION_SHARED_KV_LAYERS,305    LLM_KV_ATTENTION_RECURRENT_LAYERS,306 307    LLM_KV_HYPER_CONNECTION_COUNT,308    LLM_KV_HYPER_CONNECTION_SINKHORN_ITERATIONS,309    LLM_KV_HYPER_CONNECTION_EPSILON,310    LLM_KV_HYPER_CONNECTION_MAGNITUDE,311    LLM_KV_HYPER_CONNECTION_LOW_RANK,312 313    LLM_KV_PLE_LAYERS,314    LLM_KV_PLE_NGRAM_SIZE,315    LLM_KV_PLE_HEADS_PER_NGRAM,316    LLM_KV_PLE_CONV_KERNEL,317    LLM_KV_PLE_LAYER_MULTIPLIERS,318    LLM_KV_PLE_HEAD_OFFSETS,319    LLM_KV_PLE_HEAD_VOCAB_SIZES,320    LLM_KV_PLE_EOS_TOKEN_ID,321    LLM_KV_PLE_IMAGE_TOKEN_ID,322 323    LLM_KV_HASH_LAYER_COUNT,324 325    LLM_KV_ROPE_DIMENSION_COUNT,326    LLM_KV_ROPE_DIMENSION_COUNT_SWA,327    LLM_KV_ROPE_DIMENSION_SECTIONS,328    LLM_KV_ROPE_FREQ_BASE,329    LLM_KV_ROPE_FREQ_BASE_SWA,330    LLM_KV_ROPE_SCALE_LINEAR,331    LLM_KV_ROPE_SCALING_TYPE,332    LLM_KV_ROPE_SCALING_FACTOR,333    LLM_KV_ROPE_SCALING_ALPHA,334    LLM_KV_ROPE_SCALING_ATTN_FACTOR,335    LLM_KV_ROPE_SCALING_ORIG_CTX_LEN,336    LLM_KV_ROPE_SCALING_FINETUNED,337    LLM_KV_ROPE_SCALING_YARN_LOG_MUL,338    LLM_KV_ROPE_SCALING_YARN_EXT_FACTOR,339    LLM_KV_ROPE_SCALING_YARN_ATTN_FACTOR,340    LLM_KV_ROPE_SCALING_YARN_BETA_FAST,341    LLM_KV_ROPE_SCALING_YARN_BETA_SLOW,342 343    LLM_KV_SPLIT_NO,344    LLM_KV_SPLIT_COUNT,345    LLM_KV_SPLIT_TENSORS_COUNT,346 347    LLM_KV_SSM_INNER_SIZE,348    LLM_KV_SSM_CONV_KERNEL,349    LLM_KV_SSM_STATE_SIZE,350    LLM_KV_SSM_TIME_STEP_RANK,351    LLM_KV_SSM_GROUP_COUNT,352    LLM_KV_SSM_DT_B_C_RMS,353 354    LLM_KV_KDA_HEAD_DIM,355    LLM_KV_KDA_SAFE_GATE,356    LLM_KV_KDA_GATE_LOWER_BOUND,357 358    LLM_KV_WKV_HEAD_SIZE,359 360    LLM_KV_TOKENIZER_MODEL,361    LLM_KV_TOKENIZER_PRE,362    LLM_KV_TOKENIZER_LIST,363    LLM_KV_TOKENIZER_TOKEN_TYPE,364    LLM_KV_TOKENIZER_TOKEN_TYPE_COUNT,365    LLM_KV_TOKENIZER_SCORES,366    LLM_KV_TOKENIZER_MERGES,367    LLM_KV_TOKENIZER_BOS_ID,368    LLM_KV_TOKENIZER_EOS_ID,369    LLM_KV_TOKENIZER_EOT_ID,370    LLM_KV_TOKENIZER_EOM_ID,371    LLM_KV_TOKENIZER_UNK_ID,372    LLM_KV_TOKENIZER_SEP_ID,373    LLM_KV_TOKENIZER_PAD_ID,374    LLM_KV_TOKENIZER_CLS_ID,375    LLM_KV_TOKENIZER_MASK_ID,376    LLM_KV_TOKENIZER_ADD_BOS,377    LLM_KV_TOKENIZER_ADD_EOS,378    LLM_KV_TOKENIZER_ADD_SEP,379    LLM_KV_TOKENIZER_ADD_PREFIX,380    LLM_KV_TOKENIZER_REMOVE_EXTRA_WS,381    LLM_KV_TOKENIZER_PRECOMPILED_CHARSMAP,382    LLM_KV_TOKENIZER_HF_JSON,383    LLM_KV_TOKENIZER_RWKV,384    LLM_KV_TOKENIZER_CHAT_TEMPLATE,385    LLM_KV_TOKENIZER_NORMALIZER_LOWERCASE,386    LLM_KV_TOKENIZER_NORMALIZER_STRIP_ACCENTS,387    LLM_KV_TOKENIZER_FIM_PRE_ID,388    LLM_KV_TOKENIZER_FIM_SUF_ID,389    LLM_KV_TOKENIZER_FIM_MID_ID,390    LLM_KV_TOKENIZER_FIM_PAD_ID,391    LLM_KV_TOKENIZER_FIM_REP_ID,392    LLM_KV_TOKENIZER_FIM_SEP_ID,393    LLM_KV_TOKENIZER_SUPPRESS_TOKENS,394 395    LLM_KV_ADAPTER_TYPE,396    LLM_KV_ADAPTER_LORA_ALPHA,397    LLM_KV_ADAPTER_LORA_TASK_NAME,398    LLM_KV_ADAPTER_LORA_PROMPT_PREFIX,399    LLM_KV_ADAPTER_ALORA_INVOCATION_TOKENS,400 401    LLM_KV_POSNET_EMBEDDING_LENGTH,402    LLM_KV_POSNET_BLOCK_COUNT,403 404    LLM_KV_CONVNEXT_EMBEDDING_LENGTH,405    LLM_KV_CONVNEXT_BLOCK_COUNT,406 407    LLM_KV_CLASSIFIER_OUTPUT_LABELS,408 409    LLM_KV_TARGET_LAYERS,410    LLM_KV_TARGET_HIDDEN_SIZE,411    LLM_KV_DFLASH_BLOCK_SIZE,412    LLM_KV_DFLASH_CONV_KERNEL_SIZE,413    LLM_KV_DFLASH_CONV_GROUP_SIZE,414    LLM_KV_DFLASH_SELECTOR_RANK,415    LLM_KV_DFLASH_SELECTOR_TOP_K,416    LLM_KV_NORM_BEFORE_RESIDUAL,417    LLM_KV_NORM_BEFORE_FC,418 419    LLM_KV_SHORTCONV_L_CACHE,420 421    LLM_KV_XIELU_ALPHA_N,422    LLM_KV_XIELU_ALPHA_P,423    LLM_KV_XIELU_BETA,424    LLM_KV_XIELU_EPS,425 426    // deprecated:427    LLM_KV_TOKENIZER_PREFIX_ID,428    LLM_KV_TOKENIZER_SUFFIX_ID,429    LLM_KV_TOKENIZER_MIDDLE_ID,430 431    // sentence-transformers dense layers in and out features432    LLM_KV_DENSE_2_FEAT_IN,433    LLM_KV_DENSE_2_FEAT_OUT,434    LLM_KV_DENSE_3_FEAT_IN,435    LLM_KV_DENSE_3_FEAT_OUT,436};437 438enum llm_tensor {439    LLM_TENSOR_TOKEN_EMBD,440    LLM_TENSOR_TOKEN_EMBD_NORM,441    LLM_TENSOR_TOKEN_TYPES,442    LLM_TENSOR_POS_EMBD,443    LLM_TENSOR_DENSE_2_OUT,444    LLM_TENSOR_DENSE_3_OUT,445    LLM_TENSOR_OUTPUT,446    LLM_TENSOR_OUTPUT_NORM,447    LLM_TENSOR_OUTPUT_NORM_LFM2, // fix for wrong tensor name448    LLM_TENSOR_ROPE_FREQS,449    LLM_TENSOR_ROPE_FACTORS_LONG,450    LLM_TENSOR_ROPE_FACTORS_SHORT,451    LLM_TENSOR_ATTN_Q,452    LLM_TENSOR_ATTN_K,453    LLM_TENSOR_ATTN_V,454    LLM_TENSOR_ATTN_QKV,455    LLM_TENSOR_ATTN_OUT,456    LLM_TENSOR_ATTN_NORM,457    LLM_TENSOR_ATTN_NORM_2,458    LLM_TENSOR_ATTN_OUT_NORM,459    LLM_TENSOR_ATTN_POST_NORM,460    LLM_TENSOR_ATTN_ROT_EMBD,461    LLM_TENSOR_ATTN_SINKS,462    LLM_TENSOR_ATTN_GATE,463    LLM_TENSOR_FFN_GATE_INP,464    LLM_TENSOR_FFN_GATE_INP_SHEXP,465    LLM_TENSOR_FFN_NORM,466    LLM_TENSOR_FFN_POST_NORM,467    LLM_TENSOR_FFN_POST_NORM_1,468    LLM_TENSOR_FFN_POST_NORM_2,469    LLM_TENSOR_FFN_PRE_NORM_2,470    LLM_TENSOR_FFN_GATE,471    LLM_TENSOR_FFN_DOWN,472    LLM_TENSOR_FFN_UP,473    LLM_TENSOR_FFN_ACT,474    LLM_TENSOR_FFN_DOWN_EXP,  // split experts for backward compatibility475    LLM_TENSOR_FFN_GATE_EXP,476    LLM_TENSOR_FFN_UP_EXP,477    LLM_TENSOR_FFN_NORM_EXPS,478    LLM_TENSOR_FFN_DOWN_EXPS, // merged experts479    LLM_TENSOR_FFN_GATE_EXPS,480    LLM_TENSOR_FFN_UP_EXPS,481    LLM_TENSOR_FFN_GATE_UP_EXPS,482    LLM_TENSOR_FFN_DOWN_SHEXP,483    LLM_TENSOR_FFN_GATE_SHEXP,484    LLM_TENSOR_FFN_UP_SHEXP,485    LLM_TENSOR_FFN_DOWN_CHEXPS,486    LLM_TENSOR_FFN_GATE_CHEXPS,487    LLM_TENSOR_FFN_UP_CHEXPS,488    LLM_TENSOR_FFN_EXP_PROBS_B,489    LLM_TENSOR_FFN_EXP_PROBS_B_VL,490    LLM_TENSOR_FFN_LATENT_DOWN,491    LLM_TENSOR_FFN_LATENT_UP,492    LLM_TENSOR_ATTN_Q_NORM,493    LLM_TENSOR_ATTN_K_NORM,494    LLM_TENSOR_LAYER_OUT_NORM,495    LLM_TENSOR_LAYER_OUT_SCALE,496    LLM_TENSOR_POST_ATTN_NORM,497    LLM_TENSOR_POST_MLP_NORM,498    LLM_TENSOR_PER_LAYER_TOKEN_EMBD, // gemma3n499    LLM_TENSOR_PER_LAYER_MODEL_PROJ, // gemma3n500    LLM_TENSOR_PER_LAYER_INP_GATE,   // gemma3n501    LLM_TENSOR_PER_LAYER_PROJ,       // gemma3n502    LLM_TENSOR_PER_LAYER_PROJ_NORM,  // gemma3n503    LLM_TENSOR_PER_LAYER_POST_NORM,  // gemma3n504    LLM_TENSOR_ALTUP_PROJ,           // gemma3n505    LLM_TENSOR_ALTUP_UNEMBD_PROJ,    // gemma3n506    LLM_TENSOR_ALTUP_CORRECT_COEF,   // gemma3n507    LLM_TENSOR_ALTUP_CORRECT_SCALE,  // gemma3n508    LLM_TENSOR_ALTUP_PREDICT_COEF,   // gemma3n509    LLM_TENSOR_ALTUP_ROUTER,         // gemma3n510    LLM_TENSOR_ALTUP_ROUTER_NORM,    // gemma3n511    LLM_TENSOR_LAUREL_L,             // gemma3n512    LLM_TENSOR_LAUREL_R,             // gemma3n513    LLM_TENSOR_LAUREL_POST_NORM,     // gemma3n514    LLM_TENSOR_SSM_IN,515    LLM_TENSOR_SSM_CONV1D,516    LLM_TENSOR_SSM_X,517    LLM_TENSOR_SSM_DT,518    LLM_TENSOR_SSM_DT_NORM,519    LLM_TENSOR_SSM_A,520    LLM_TENSOR_SSM_A_NOSCAN,        // qwen3next special case with MUL instead of SSM_SCAN521    LLM_TENSOR_SSM_B_NORM,522    LLM_TENSOR_SSM_C_NORM,523    LLM_TENSOR_SSM_D,524    LLM_TENSOR_SSM_NORM,525    LLM_TENSOR_SSM_OUT,526    LLM_TENSOR_SSM_BETA_ALPHA,      // qwen3next527    LLM_TENSOR_SSM_ALPHA,           // qwen3.5528    // Kimi Linear KDA (using SSM_ prefix for consistency)529    LLM_TENSOR_SSM_CONV1D_Q,        // kimi: Q conv1d weight530    LLM_TENSOR_SSM_CONV1D_K,        // kimi: K conv1d weight531    LLM_TENSOR_SSM_CONV1D_V,        // kimi: V conv1d weight532    LLM_TENSOR_SSM_F_A,             // kimi: forget gate projection A533    LLM_TENSOR_SSM_F_B,             // kimi: forget gate projection B534    LLM_TENSOR_SSM_BETA,            // kimi: beta mixing coefficient and qwen3.5535    LLM_TENSOR_SSM_G_A,             // kimi: output gate projection A536    LLM_TENSOR_SSM_G_B,             // kimi: output gate projection B537    LLM_TENSOR_SSM_G,               // kimi-k3: full-rank KDA gate538    LLM_TENSOR_ATTN_RES_SCORE,      // kimi-k3: fused res_norm*res_proj (pre-attn)539    LLM_TENSOR_FFN_RES_SCORE,       // kimi-k3: fused res_norm*res_proj (pre-ffn)540    LLM_TENSOR_OUTPUT_RES_SCORE,    // kimi-k3: fused res_norm*res_proj (final)541    LLM_TENSOR_FFN_ROUTED_DOWN,     // kimi-k3: latent MoE down542    LLM_TENSOR_FFN_ROUTED_UP,       // kimi-k3: latent MoE up543    LLM_TENSOR_FFN_ROUTED_NORM,     // kimi-k3: latent MoE norm544    LLM_TENSOR_TIME_MIX_W0,545    LLM_TENSOR_TIME_MIX_W1,546    LLM_TENSOR_TIME_MIX_W2,547    LLM_TENSOR_TIME_MIX_A0,548    LLM_TENSOR_TIME_MIX_A1,549    LLM_TENSOR_TIME_MIX_A2,550    LLM_TENSOR_TIME_MIX_V0,551    LLM_TENSOR_TIME_MIX_V1,552    LLM_TENSOR_TIME_MIX_V2,553    LLM_TENSOR_TIME_MIX_G1,554    LLM_TENSOR_TIME_MIX_G2,555    LLM_TENSOR_TIME_MIX_K_K,556    LLM_TENSOR_TIME_MIX_K_A,557    LLM_TENSOR_TIME_MIX_R_K,558    LLM_TENSOR_TIME_MIX_LERP_X,559    LLM_TENSOR_TIME_MIX_LERP_W,560    LLM_TENSOR_TIME_MIX_LERP_K,561    LLM_TENSOR_TIME_MIX_LERP_V,562    LLM_TENSOR_TIME_MIX_LERP_R,563    LLM_TENSOR_TIME_MIX_LERP_G,564    LLM_TENSOR_TIME_MIX_LERP_FUSED,565    LLM_TENSOR_TIME_MIX_FIRST,566    LLM_TENSOR_TIME_MIX_DECAY,567    LLM_TENSOR_TIME_MIX_DECAY_W1,568    LLM_TENSOR_TIME_MIX_DECAY_W2,569    LLM_TENSOR_TIME_MIX_KEY,570    LLM_TENSOR_TIME_MIX_VALUE,571    LLM_TENSOR_TIME_MIX_RECEPTANCE,572    LLM_TENSOR_TIME_MIX_GATE,573    LLM_TENSOR_TIME_MIX_LN,574    LLM_TENSOR_TIME_MIX_OUTPUT,575    LLM_TENSOR_CHANNEL_MIX_LERP_K,576    LLM_TENSOR_CHANNEL_MIX_LERP_R,577    LLM_TENSOR_CHANNEL_MIX_KEY,578    LLM_TENSOR_CHANNEL_MIX_RECEPTANCE,579    LLM_TENSOR_CHANNEL_MIX_VALUE,580    LLM_TENSOR_ATTN_Q_A,581    LLM_TENSOR_ATTN_Q_B,582    LLM_TENSOR_ATTN_KV_A_MQA,583    LLM_TENSOR_ATTN_KV_B,584    LLM_TENSOR_ATTN_KV,585    LLM_TENSOR_ATTN_KV_NORM,586    LLM_TENSOR_ATTN_OUT_A,587    LLM_TENSOR_ATTN_OUT_B,588    LLM_TENSOR_ATTN_K_B,589    LLM_TENSOR_ATTN_V_B,590    LLM_TENSOR_ATTN_Q_A_NORM,591    LLM_TENSOR_ATTN_KV_A_NORM,592    LLM_TENSOR_HC_HEAD_FN,593    LLM_TENSOR_HC_HEAD_BASE,594    LLM_TENSOR_HC_HEAD_SCALE,595    LLM_TENSOR_HC_HEAD_NORM,   // qwen4exp596    LLM_TENSOR_HC_HEAD_DOWN,   // qwen4exp597    LLM_TENSOR_HC_HEAD_UP,     // qwen4exp598    LLM_TENSOR_HC_ATTN_FN,599    LLM_TENSOR_HC_ATTN_BASE,600    LLM_TENSOR_HC_ATTN_SCALE,601    LLM_TENSOR_HC_FFN_FN,602    LLM_TENSOR_HC_FFN_BASE,603    LLM_TENSOR_HC_FFN_SCALE,604    LLM_TENSOR_HC_ATTN_NORM,   // qwen4exp605    LLM_TENSOR_HC_ATTN_DOWN,   // qwen4exp606    LLM_TENSOR_HC_ATTN_UP,     // qwen4exp607    LLM_TENSOR_HC_ATTN_INJECT, // qwen4exp608    LLM_TENSOR_HC_FFN_NORM,    // qwen4exp609    LLM_TENSOR_HC_FFN_DOWN,    // qwen4exp610    LLM_TENSOR_HC_FFN_UP,      // qwen4exp611    LLM_TENSOR_HC_FFN_INJECT,  // qwen4exp612    LLM_TENSOR_PLE_KEY,        // qwen4exp613    LLM_TENSOR_PLE_VALUE,      // qwen4exp614    LLM_TENSOR_PLE_NORM_KEY,   // qwen4exp615    LLM_TENSOR_PLE_NORM_QUERY, // qwen4exp616    LLM_TENSOR_PLE_NORM_CONV,  // qwen4exp617    LLM_TENSOR_PLE_CONV1D,     // qwen4exp618    LLM_TENSOR_ATTN_COMPRESSOR_WKV,619    LLM_TENSOR_ATTN_COMPRESSOR_WGATE,620    LLM_TENSOR_ATTN_COMPRESSOR_APE,621    LLM_TENSOR_ATTN_COMPRESSOR_NORM,622    LLM_TENSOR_ATTN_SUB_NORM,623    LLM_TENSOR_FFN_SUB_NORM,624    LLM_TENSOR_DEC_ATTN_NORM,625    LLM_TENSOR_DEC_ATTN_Q,626    LLM_TENSOR_DEC_ATTN_K,627    LLM_TENSOR_DEC_ATTN_V,628    LLM_TENSOR_DEC_ATTN_OUT,629    LLM_TENSOR_DEC_ATTN_REL_B,630    LLM_TENSOR_DEC_CROSS_ATTN_NORM,631    LLM_TENSOR_DEC_CROSS_ATTN_Q,632    LLM_TENSOR_DEC_CROSS_ATTN_K,633    LLM_TENSOR_DEC_CROSS_ATTN_V,634    LLM_TENSOR_DEC_CROSS_ATTN_OUT,635    LLM_TENSOR_DEC_CROSS_ATTN_REL_B,636    LLM_TENSOR_DEC_FFN_NORM,637    LLM_TENSOR_DEC_FFN_GATE,638    LLM_TENSOR_DEC_FFN_DOWN,639    LLM_TENSOR_DEC_FFN_UP,640    LLM_TENSOR_DEC_OUTPUT_NORM,641    LLM_TENSOR_ENC_ATTN_NORM,642    LLM_TENSOR_ENC_ATTN_Q,643    LLM_TENSOR_ENC_ATTN_K,644    LLM_TENSOR_ENC_ATTN_V,645    LLM_TENSOR_ENC_ATTN_OUT,646    LLM_TENSOR_ENC_ATTN_REL_B,647    LLM_TENSOR_ENC_FFN_NORM,648    LLM_TENSOR_ENC_FFN_GATE,649    LLM_TENSOR_ENC_FFN_DOWN,650    LLM_TENSOR_ENC_FFN_UP,651    LLM_TENSOR_ENC_OUTPUT_NORM,652    LLM_TENSOR_CLS,653    LLM_TENSOR_CLS_OUT,654    LLM_TENSOR_CLS_NORM,655    LLM_TENSOR_CONV1D,656    LLM_TENSOR_CONVNEXT_DW,657    LLM_TENSOR_CONVNEXT_NORM,658    LLM_TENSOR_CONVNEXT_PW1,659    LLM_TENSOR_CONVNEXT_PW2,660    LLM_TENSOR_CONVNEXT_GAMMA,661    LLM_TENSOR_POS_NET_CONV1,662    LLM_TENSOR_POS_NET_CONV2,663    LLM_TENSOR_POS_NET_NORM,664    LLM_TENSOR_POS_NET_NORM1,665    LLM_TENSOR_POS_NET_NORM2,666    LLM_TENSOR_POS_NET_ATTN_NORM,667    LLM_TENSOR_POS_NET_ATTN_Q,668    LLM_TENSOR_POS_NET_ATTN_K,669    LLM_TENSOR_POS_NET_ATTN_V,670    LLM_TENSOR_POS_NET_ATTN_OUT,671    LLM_TENSOR_SHORTCONV_CONV,672    LLM_TENSOR_SHORTCONV_INPROJ,673    LLM_TENSOR_SHORTCONV_OUTPROJ,674    LLM_TENSOR_VISEXP_ATTN_QKV,675    LLM_TENSOR_VISEXP_ATTN_OUT,676    LLM_TENSOR_VISEXP_FFN_GATE,677    LLM_TENSOR_VISEXP_FFN_DOWN,678    LLM_TENSOR_VISEXP_FFN_UP,679    LLM_TENSOR_INDEXER_K_NORM,680    LLM_TENSOR_INDEXER_PROJ,681    LLM_TENSOR_INDEXER_ATTN_K,682    LLM_TENSOR_INDEXER_ATTN_Q_B,683    LLM_TENSOR_INDEXER_Q_PROJ,684    LLM_TENSOR_INDEXER_K_PROJ,685    LLM_TENSOR_INDEXER_Q_NORM,686    LLM_TENSOR_INDEXER_COMPRESSOR_WKV,687    LLM_TENSOR_INDEXER_COMPRESSOR_WGATE,688    LLM_TENSOR_INDEXER_COMPRESSOR_APE,689    LLM_TENSOR_INDEXER_COMPRESSOR_NORM,690    LLM_TENSOR_FFN_GATE_TID2EID,691    LLM_TENSOR_NEXTN_PROJ_PRE,692    LLM_TENSOR_NEXTN_PROJ_POST,693    LLM_TENSOR_NEXTN_EH_PROJ,694    LLM_TENSOR_NEXTN_EMBED_TOKENS,695    LLM_TENSOR_NEXTN_ENORM,696    LLM_TENSOR_NEXTN_HNORM,697    LLM_TENSOR_NEXTN_SHARED_HEAD_HEAD,698    LLM_TENSOR_NEXTN_SHARED_HEAD_NORM,699    LLM_TENSOR_MASKED_EMBD_CENTROIDS,700    LLM_TENSOR_MASKED_EMBD_ORDERING,701    LLM_TENSOR_HRM_Z_L_INIT,702    LLM_TENSOR_FC,703    LLM_TENSOR_D2T,704    LLM_TENSOR_DSPARK_MARKOV_W1,705    LLM_TENSOR_DSPARK_MARKOV_W2,706    LLM_TENSOR_DSPARK_CONF_PROJ,707    LLM_TENSOR_DFLASH_ATTN_CONV_BASE,708    LLM_TENSOR_DFLASH_ATTN_CONV_PROJ,709    LLM_TENSOR_DFLASH_FFN_CONV_BASE,710    LLM_TENSOR_DFLASH_FFN_CONV_PROJ,711    LLM_TENSOR_DFLASH_SELECTOR_PREV,712    LLM_TENSOR_DFLASH_SELECTOR_NEXT,713    LLM_TENSOR_DFLASH_SELECTOR_HIDDEN,714};715 716 717enum llm_tensor_layer {718    LLM_TENSOR_LAYER_INPUT,719    LLM_TENSOR_LAYER_REPEATING,720    LLM_TENSOR_LAYER_OUTPUT,721};722 723struct LLM_KV {724    LLM_KV(llm_arch arch, const char * suffix = nullptr);725 726    llm_arch arch;727    const char * suffix;728 729    std::string operator()(llm_kv kv) const;730};731 732// helper to handle gguf constants733// usage:734//735//   const auto tn = LLM_TN(LLM_ARCH_LLAMA);736//737//   std::string name = tn(LLM_TENSOR_OUTPUT);                     -> "output"738//   std::string name = tn(LLM_TENSOR_TOKEN_EMBD, "bias");         -> "token_embd.bias"739//   std::string name = tn(LLM_TENSOR_ATTN_NORM, "weight", 3);     -> "blk.3.attn_norm.weight"740//741struct LLM_TN_IMPL {742    const llm_arch arch;743    const llm_tensor tensor;744    const char * const suffix;745    const int bid;746    const int xid;747 748    LLM_TN_IMPL(llm_arch arch, llm_tensor tensor, const char * suffix, int bid, int xid);749 750    std::string str() const;751 752    operator std::string() const {753        return str();754    }755 756    friend bool operator==(const std::string & str, const LLM_TN_IMPL & tn) {757        return str == tn.str();758    }759 760    friend bool operator!=(const std::string & str, const LLM_TN_IMPL & tn) {761        return str != tn.str();762    }763};764 765struct LLM_TN {766    LLM_TN(llm_arch arch) : arch(arch) {}767 768    llm_arch arch;769 770    LLM_TN_IMPL operator()(llm_tensor tensor, const char * suffix, int bid = -1, int xid = -1) const {771        return LLM_TN_IMPL(arch, tensor, suffix, bid, xid);772    }773 774    LLM_TN_IMPL operator()(llm_tensor tensor, int bid = -1, int xid = -1) const {775        return LLM_TN_IMPL(arch, tensor, nullptr, bid, xid);776    }777};778 779 780struct llm_tensor_info {781    llm_tensor_layer layer;782    ggml_op op;783};784 785std::vector<llm_arch> llm_arch_all();786 787const char * llm_arch_name(llm_arch arch);788 789llm_arch llm_arch_from_string(const std::string & name);790 791const llm_tensor_info & llm_tensor_info_for(llm_tensor tensor);792 793bool llm_arch_is_recurrent      (const llm_arch & arch);794bool llm_arch_is_hybrid         (const llm_arch & arch);795bool llm_arch_is_diffusion      (const llm_arch & arch);796bool llm_arch_supports_sm_tensor(const llm_arch & arch);797bool llm_arch_supports_rs_rollback(const llm_arch & arch);798