Felipe97/llama-cpp-compiled
01.1k
1#pragma once2 3#include "ggml.h" // ggml_op4 5#include <string>6#include <set>7#include <vector>8 9//10// gguf constants (sync with gguf.py)11//12 13enum llm_arch {14 LLM_ARCH_CLIP,15 LLM_ARCH_LLAMA,16 LLM_ARCH_LLAMA4,17 LLM_ARCH_DECI,18 LLM_ARCH_FALCON,19 LLM_ARCH_BAICHUAN,20 LLM_ARCH_GROK,21 LLM_ARCH_GPT2,22 LLM_ARCH_GPTJ,23 LLM_ARCH_GPTNEOX,24 LLM_ARCH_MPT,25 LLM_ARCH_STARCODER,26 LLM_ARCH_REFACT,27 LLM_ARCH_BERT,28 LLM_ARCH_MODERN_BERT,29 LLM_ARCH_NOMIC_BERT,30 LLM_ARCH_NOMIC_BERT_MOE,31 LLM_ARCH_NEO_BERT,32 LLM_ARCH_JINA_BERT_V2,33 LLM_ARCH_JINA_BERT_V3,34 LLM_ARCH_EUROBERT,35 LLM_ARCH_BLOOM,36 LLM_ARCH_STABLELM,37 LLM_ARCH_QWEN,38 LLM_ARCH_QWEN2,39 LLM_ARCH_QWEN2MOE,40 LLM_ARCH_QWEN2VL,41 LLM_ARCH_QWEN3,42 LLM_ARCH_QWEN3MOE,43 LLM_ARCH_QWEN3NEXT,44 LLM_ARCH_QWEN3VL,45 LLM_ARCH_QWEN3VLMOE,46 LLM_ARCH_QWEN35,47 LLM_ARCH_QWEN35MOE,48 LLM_ARCH_QWEN4EXP,49 LLM_ARCH_PHI2,50 LLM_ARCH_PHI3,51 LLM_ARCH_PHIMOE,52 LLM_ARCH_PLAMO,53 LLM_ARCH_PLAMO2,54 LLM_ARCH_PLAMO3,55 LLM_ARCH_CODESHELL,56 LLM_ARCH_ORION,57 LLM_ARCH_INTERNLM2,58 LLM_ARCH_MINICPM,59 LLM_ARCH_MINICPM3,60 LLM_ARCH_GEMMA,61 LLM_ARCH_GEMMA2,62 LLM_ARCH_GEMMA3,63 LLM_ARCH_GEMMA3N,64 LLM_ARCH_GEMMA4,65 LLM_ARCH_GEMMA4_ASSISTANT,66 LLM_ARCH_GEMMA_EMBEDDING,67 LLM_ARCH_STARCODER2,68 LLM_ARCH_MAMBA,69 LLM_ARCH_MAMBA2,70 LLM_ARCH_MAPLE,71 LLM_ARCH_JAMBA,72 LLM_ARCH_FALCON_H1,73 LLM_ARCH_XVERSE,74 LLM_ARCH_COMMAND_R,75 LLM_ARCH_COHERE2,76 LLM_ARCH_COHERE2MOE,77 LLM_ARCH_DBRX,78 LLM_ARCH_OLMO,79 LLM_ARCH_OLMO2,80 LLM_ARCH_OLMOE,81 LLM_ARCH_MUSE_GLIMMER,82 LLM_ARCH_OPENELM,83 LLM_ARCH_ARCTIC,84 LLM_ARCH_DEEPSEEK,85 LLM_ARCH_DEEPSEEK2,86 LLM_ARCH_DEEPSEEK2OCR,87 LLM_ARCH_DEEPSEEK32,88 LLM_ARCH_DEEPSEEK4,89 LLM_ARCH_CHATGLM,90 LLM_ARCH_GLM4,91 LLM_ARCH_GLM4_MOE,92 LLM_ARCH_GLM_DSA,93 LLM_ARCH_BITNET,94 LLM_ARCH_T5,95 LLM_ARCH_T5ENCODER,96 LLM_ARCH_JAIS,97 LLM_ARCH_JAIS2,98 LLM_ARCH_NEMOTRON,99 LLM_ARCH_NEMOTRON_H,100 LLM_ARCH_NEMOTRON_H_MOE,101 LLM_ARCH_EXAONE,102 LLM_ARCH_EXAONE4,103 LLM_ARCH_EXAONE_MOE,104 LLM_ARCH_RWKV6,105 LLM_ARCH_RWKV6QWEN2,106 LLM_ARCH_RWKV7,107 LLM_ARCH_ARWKV7,108 LLM_ARCH_GRANITE,109 LLM_ARCH_GRANITE_MOE,110 LLM_ARCH_GRANITE_HYBRID,111 LLM_ARCH_GRANITE_SWITCH,112 LLM_ARCH_GRANITE_SWA,113 LLM_ARCH_CHAMELEON,114 LLM_ARCH_WAVTOKENIZER_DEC,115 LLM_ARCH_PLM,116 LLM_ARCH_BAILINGMOE,117 LLM_ARCH_BAILINGMOE2,118 LLM_ARCH_BAILINGMOE3,119 LLM_ARCH_DOTS1,120 LLM_ARCH_DOTS3NOTE,121 LLM_ARCH_ARCEE,122 LLM_ARCH_AFMOE,123 LLM_ARCH_LAGUNA,124 LLM_ARCH_ERNIE4_5,125 LLM_ARCH_ERNIE4_5_MOE,126 LLM_ARCH_HUNYUAN_MOE,127 LLM_ARCH_HUNYUAN_DENSE,128 LLM_ARCH_HUNYUAN_VL,129 LLM_ARCH_HY_V3,130 LLM_ARCH_HY_V4,131 LLM_ARCH_SMOLLM3,132 LLM_ARCH_OPENAI_MOE,133 LLM_ARCH_LFM2,134 LLM_ARCH_LFM2MOE,135 LLM_ARCH_DREAM,136 LLM_ARCH_SMALLTHINKER,137 LLM_ARCH_LLADA,138 LLM_ARCH_LLADA_MOE,139 LLM_ARCH_SEED_OSS,140 LLM_ARCH_GROVEMOE,141 LLM_ARCH_APERTUS,142 LLM_ARCH_MINIMAX_M2,143 LLM_ARCH_COGVLM,144 LLM_ARCH_RND1,145 LLM_ARCH_PANGU_EMBED,146 LLM_ARCH_MISTRAL3,147 LLM_ARCH_MISTRAL4,148 LLM_ARCH_PADDLEOCR,149 LLM_ARCH_MIMO2,150 LLM_ARCH_STEP35,151 LLM_ARCH_SPARK2_5,152 LLM_ARCH_LLAMA_EMBED,153 LLM_ARCH_MAINCODER,154 LLM_ARCH_KIMI_LINEAR,155 LLM_ARCH_KIMI_K3,156 LLM_ARCH_TALKIE,157 LLM_ARCH_MELLUM,158 LLM_ARCH_EAGLE3,159 LLM_ARCH_MINIMAX_M3,160 LLM_ARCH_DFLASH,161 LLM_ARCH_NANBEIGE,162 LLM_ARCH_QWEN3TTS,163 LLM_ARCH_POCKETTTS,164 LLM_ARCH_MINIMAX_01,165 LLM_ARCH_HRM_TEXT,166 LLM_ARCH_UNKNOWN,167};168 169enum llm_kv {170 LLM_KV_GENERAL_TYPE,171 LLM_KV_GENERAL_ARCHITECTURE,172 LLM_KV_GENERAL_QUANTIZATION_VERSION,173 LLM_KV_GENERAL_ALIGNMENT,174 LLM_KV_GENERAL_FILE_TYPE,175 LLM_KV_GENERAL_SAMPLING_SEQUENCE,176 LLM_KV_GENERAL_SAMPLING_TOP_K,177 LLM_KV_GENERAL_SAMPLING_TOP_P,178 LLM_KV_GENERAL_SAMPLING_MIN_P,179 LLM_KV_GENERAL_SAMPLING_XTC_PROBABILITY,180 LLM_KV_GENERAL_SAMPLING_XTC_THRESHOLD,181 LLM_KV_GENERAL_SAMPLING_TEMP,182 LLM_KV_GENERAL_SAMPLING_PENALTY_LAST_N,183 LLM_KV_GENERAL_SAMPLING_PENALTY_REPEAT,184 LLM_KV_GENERAL_SAMPLING_MIROSTAT,185 LLM_KV_GENERAL_SAMPLING_MIROSTAT_TAU,186 LLM_KV_GENERAL_SAMPLING_MIROSTAT_ETA,187 LLM_KV_GENERAL_NAME,188 LLM_KV_GENERAL_AUTHOR,189 LLM_KV_GENERAL_VERSION,190 LLM_KV_GENERAL_URL,191 LLM_KV_GENERAL_DESCRIPTION,192 LLM_KV_GENERAL_LICENSE,193 LLM_KV_GENERAL_SOURCE_URL,194 LLM_KV_GENERAL_SOURCE_HF_REPO,195 196 LLM_KV_VOCAB_SIZE,197 LLM_KV_CONTEXT_LENGTH,198 LLM_KV_EMBEDDING_LENGTH,199 LLM_KV_EMBEDDING_LENGTH_OUT,200 LLM_KV_EMBEDDING_LENGTH_PER_LAYER,201 LLM_KV_FEATURES_LENGTH,202 LLM_KV_BLOCK_COUNT,203 LLM_KV_LEADING_DENSE_BLOCK_COUNT,204 LLM_KV_ATTN_RES_BLOCK_SIZE,205 LLM_KV_ACTIVATION_SITU_BETA,206 LLM_KV_ACTIVATION_SITU_LINEAR_BETA,207 LLM_KV_FEED_FORWARD_LENGTH,208 LLM_KV_EXPERT_FEED_FORWARD_LENGTH,209 LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH,210 LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH,211 LLM_KV_SWIGLU_CLAMP_EXP,212 LLM_KV_SWIGLU_CLAMP_SHEXP,213 LLM_KV_USE_PARALLEL_RESIDUAL,214 LLM_KV_TENSOR_DATA_LAYOUT,215 LLM_KV_EXPERT_COUNT,216 LLM_KV_EXPERT_USED_COUNT,217 LLM_KV_EXPERT_SHARED_COUNT,218 LLM_KV_EXPERT_GROUP_COUNT,219 LLM_KV_EXPERT_GROUP_USED_COUNT,220 LLM_KV_EXPERT_WEIGHTS_SCALE,221 LLM_KV_EXPERT_WEIGHTS_NORM,222 LLM_KV_EXPERT_LATENT_LENGTH,223 LLM_KV_EXPERT_GATING_FUNC,224 LLM_KV_EXPERT_GROUP_SCALE,225 LLM_KV_EXPERTS_PER_GROUP,226 LLM_KV_MOE_EVERY_N_LAYERS,227 LLM_KV_MOE_LATENT_SIZE,228 LLM_KV_NEXTN_PREDICT_LAYERS,229 LLM_KV_NUM_DEEPSTACK_LAYERS,230 LLM_KV_DEEPSTACK_MAPPING,231 LLM_KV_HIDDEN_ACT,232 LLM_KV_POOLING_TYPE,233 LLM_KV_LOGIT_SCALE,234 LLM_KV_DECODER_START_TOKEN_ID,235 LLM_KV_DECODER_BLOCK_COUNT,236 LLM_KV_ATTN_LOGIT_SOFTCAPPING,237 LLM_KV_ROUTER_LOGIT_SOFTCAPPING,238 LLM_KV_FINAL_LOGIT_SOFTCAPPING,239 LLM_KV_SWIN_NORM,240 LLM_KV_RESCALE_EVERY_N_LAYERS,241 LLM_KV_TIME_MIX_EXTRA_DIM,242 LLM_KV_TIME_DECAY_EXTRA_DIM,243 LLM_KV_RESIDUAL_SCALE,244 LLM_KV_EMBEDDING_SCALE,245 LLM_KV_ADAPTER_COUNT,246 LLM_KV_ADAPTER_TOKEN_IDS_ACTIVATE,247 LLM_KV_ADAPTER_TOKEN_IDS_SUBSTITUTE,248 LLM_KV_ADAPTER_LORA_RANK,249 LLM_KV_ADAPTER_ROUTER_GAIN,250 LLM_KV_TOKEN_SHIFT_COUNT,251 LLM_KV_INTERLEAVE_MOE_LAYER_STEP,252 LLM_KV_FULL_ATTENTION_INTERVAL,253 LLM_KV_NUM_LOOPS,254 LLM_KV_SKIP_LOOP_FINAL_NORM,255 LLM_KV_HRM_LAYERS_PER_STACK,256 LLM_KV_HRM_H_CYCLES,257 LLM_KV_HRM_L_CYCLES,258 LLM_KV_HRM_PREFIX_LM,259 260 LLM_KV_ATTENTION_HEAD_COUNT,261 LLM_KV_ATTENTION_HEAD_COUNT_KV,262 LLM_KV_ATTENTION_MAX_ALIBI_BIAS,263 LLM_KV_ATTENTION_CLAMP_KQV,264 LLM_KV_ATTENTION_KEY_LENGTH,265 LLM_KV_ATTENTION_VALUE_LENGTH,266 LLM_KV_ATTENTION_LAYERNORM_EPS,267 LLM_KV_ATTENTION_LAYERNORM_RMS_EPS,268 LLM_KV_ATTENTION_GROUPNORM_EPS,269 LLM_KV_ATTENTION_GROUPNORM_GROUPS,270 LLM_KV_ATTENTION_CAUSAL,271 LLM_KV_ATTENTION_Q_LORA_RANK,272 LLM_KV_ATTENTION_KV_LORA_RANK,273 LLM_KV_ATTENTION_DECAY_LORA_RANK,274 LLM_KV_ATTENTION_ICLR_LORA_RANK,275 LLM_KV_ATTENTION_VALUE_RESIDUAL_MIX_LORA_RANK,276 LLM_KV_ATTENTION_GATE_LORA_RANK,277 LLM_KV_ATTENTION_RELATIVE_BUCKETS_COUNT,278 LLM_KV_ATTENTION_SLIDING_WINDOW,279 LLM_KV_ATTENTION_SLIDING_WINDOW_PATTERN,280 LLM_KV_ATTENTION_SCALE,281 LLM_KV_ATTENTION_ROPE_PATTERN,282 283 LLM_KV_ATTENTION_OUTPUT_SCALE,284 LLM_KV_ATTENTION_VALUE_SCALE,285 LLM_KV_ATTENTION_TEMPERATURE_LENGTH,286 LLM_KV_ATTENTION_TEMPERATURE_SCALE,287 LLM_KV_ATTENTION_KEY_LENGTH_MLA,288 LLM_KV_ATTENTION_VALUE_LENGTH_MLA,289 LLM_KV_ATTENTION_KEY_LENGTH_SWA,290 LLM_KV_ATTENTION_VALUE_LENGTH_SWA,291 LLM_KV_ATTENTION_KEY_LENGTH_MLA_SWA,292 LLM_KV_ATTENTION_VALUE_LENGTH_MLA_SWA,293 LLM_KV_ATTENTION_KV_LORA_RANK_SWA,294 LLM_KV_ATTENTION_INDEXER_HEAD_COUNT,295 LLM_KV_ATTENTION_INDEXER_KEY_LENGTH,296 LLM_KV_ATTENTION_INDEXER_TOP_K,297 LLM_KV_ATTENTION_INDEXER_BLOCK_SIZE,298 LLM_KV_ATTENTION_INDEXER_LOCAL_BLOCKS,299 LLM_KV_ATTENTION_INDEXER_TYPES,300 LLM_KV_ATTENTION_OUTPUT_GROUP_COUNT,301 LLM_KV_ATTENTION_OUTPUT_LORA_RANK,302 LLM_KV_ATTENTION_COMPRESS_ROPE_FREQ_BASE,303 LLM_KV_ATTENTION_COMPRESS_RATIOS,304 LLM_KV_ATTENTION_SHARED_KV_LAYERS,305 LLM_KV_ATTENTION_RECURRENT_LAYERS,306 307 LLM_KV_HYPER_CONNECTION_COUNT,308 LLM_KV_HYPER_CONNECTION_SINKHORN_ITERATIONS,309 LLM_KV_HYPER_CONNECTION_EPSILON,310 LLM_KV_HYPER_CONNECTION_MAGNITUDE,311 LLM_KV_HYPER_CONNECTION_LOW_RANK,312 313 LLM_KV_PLE_LAYERS,314 LLM_KV_PLE_NGRAM_SIZE,315 LLM_KV_PLE_HEADS_PER_NGRAM,316 LLM_KV_PLE_CONV_KERNEL,317 LLM_KV_PLE_LAYER_MULTIPLIERS,318 LLM_KV_PLE_HEAD_OFFSETS,319 LLM_KV_PLE_HEAD_VOCAB_SIZES,320 LLM_KV_PLE_EOS_TOKEN_ID,321 LLM_KV_PLE_IMAGE_TOKEN_ID,322 323 LLM_KV_HASH_LAYER_COUNT,324 325 LLM_KV_ROPE_DIMENSION_COUNT,326 LLM_KV_ROPE_DIMENSION_COUNT_SWA,327 LLM_KV_ROPE_DIMENSION_SECTIONS,328 LLM_KV_ROPE_FREQ_BASE,329 LLM_KV_ROPE_FREQ_BASE_SWA,330 LLM_KV_ROPE_SCALE_LINEAR,331 LLM_KV_ROPE_SCALING_TYPE,332 LLM_KV_ROPE_SCALING_FACTOR,333 LLM_KV_ROPE_SCALING_ALPHA,334 LLM_KV_ROPE_SCALING_ATTN_FACTOR,335 LLM_KV_ROPE_SCALING_ORIG_CTX_LEN,336 LLM_KV_ROPE_SCALING_FINETUNED,337 LLM_KV_ROPE_SCALING_YARN_LOG_MUL,338 LLM_KV_ROPE_SCALING_YARN_EXT_FACTOR,339 LLM_KV_ROPE_SCALING_YARN_ATTN_FACTOR,340 LLM_KV_ROPE_SCALING_YARN_BETA_FAST,341 LLM_KV_ROPE_SCALING_YARN_BETA_SLOW,342 343 LLM_KV_SPLIT_NO,344 LLM_KV_SPLIT_COUNT,345 LLM_KV_SPLIT_TENSORS_COUNT,346 347 LLM_KV_SSM_INNER_SIZE,348 LLM_KV_SSM_CONV_KERNEL,349 LLM_KV_SSM_STATE_SIZE,350 LLM_KV_SSM_TIME_STEP_RANK,351 LLM_KV_SSM_GROUP_COUNT,352 LLM_KV_SSM_DT_B_C_RMS,353 354 LLM_KV_KDA_HEAD_DIM,355 LLM_KV_KDA_SAFE_GATE,356 LLM_KV_KDA_GATE_LOWER_BOUND,357 358 LLM_KV_WKV_HEAD_SIZE,359 360 LLM_KV_TOKENIZER_MODEL,361 LLM_KV_TOKENIZER_PRE,362 LLM_KV_TOKENIZER_LIST,363 LLM_KV_TOKENIZER_TOKEN_TYPE,364 LLM_KV_TOKENIZER_TOKEN_TYPE_COUNT,365 LLM_KV_TOKENIZER_SCORES,366 LLM_KV_TOKENIZER_MERGES,367 LLM_KV_TOKENIZER_BOS_ID,368 LLM_KV_TOKENIZER_EOS_ID,369 LLM_KV_TOKENIZER_EOT_ID,370 LLM_KV_TOKENIZER_EOM_ID,371 LLM_KV_TOKENIZER_UNK_ID,372 LLM_KV_TOKENIZER_SEP_ID,373 LLM_KV_TOKENIZER_PAD_ID,374 LLM_KV_TOKENIZER_CLS_ID,375 LLM_KV_TOKENIZER_MASK_ID,376 LLM_KV_TOKENIZER_ADD_BOS,377 LLM_KV_TOKENIZER_ADD_EOS,378 LLM_KV_TOKENIZER_ADD_SEP,379 LLM_KV_TOKENIZER_ADD_PREFIX,380 LLM_KV_TOKENIZER_REMOVE_EXTRA_WS,381 LLM_KV_TOKENIZER_PRECOMPILED_CHARSMAP,382 LLM_KV_TOKENIZER_HF_JSON,383 LLM_KV_TOKENIZER_RWKV,384 LLM_KV_TOKENIZER_CHAT_TEMPLATE,385 LLM_KV_TOKENIZER_NORMALIZER_LOWERCASE,386 LLM_KV_TOKENIZER_NORMALIZER_STRIP_ACCENTS,387 LLM_KV_TOKENIZER_FIM_PRE_ID,388 LLM_KV_TOKENIZER_FIM_SUF_ID,389 LLM_KV_TOKENIZER_FIM_MID_ID,390 LLM_KV_TOKENIZER_FIM_PAD_ID,391 LLM_KV_TOKENIZER_FIM_REP_ID,392 LLM_KV_TOKENIZER_FIM_SEP_ID,393 LLM_KV_TOKENIZER_SUPPRESS_TOKENS,394 395 LLM_KV_ADAPTER_TYPE,396 LLM_KV_ADAPTER_LORA_ALPHA,397 LLM_KV_ADAPTER_LORA_TASK_NAME,398 LLM_KV_ADAPTER_LORA_PROMPT_PREFIX,399 LLM_KV_ADAPTER_ALORA_INVOCATION_TOKENS,400 401 LLM_KV_POSNET_EMBEDDING_LENGTH,402 LLM_KV_POSNET_BLOCK_COUNT,403 404 LLM_KV_CONVNEXT_EMBEDDING_LENGTH,405 LLM_KV_CONVNEXT_BLOCK_COUNT,406 407 LLM_KV_CLASSIFIER_OUTPUT_LABELS,408 409 LLM_KV_TARGET_LAYERS,410 LLM_KV_TARGET_HIDDEN_SIZE,411 LLM_KV_DFLASH_BLOCK_SIZE,412 LLM_KV_DFLASH_CONV_KERNEL_SIZE,413 LLM_KV_DFLASH_CONV_GROUP_SIZE,414 LLM_KV_DFLASH_SELECTOR_RANK,415 LLM_KV_DFLASH_SELECTOR_TOP_K,416 LLM_KV_NORM_BEFORE_RESIDUAL,417 LLM_KV_NORM_BEFORE_FC,418 419 LLM_KV_SHORTCONV_L_CACHE,420 421 LLM_KV_XIELU_ALPHA_N,422 LLM_KV_XIELU_ALPHA_P,423 LLM_KV_XIELU_BETA,424 LLM_KV_XIELU_EPS,425 426 // deprecated:427 LLM_KV_TOKENIZER_PREFIX_ID,428 LLM_KV_TOKENIZER_SUFFIX_ID,429 LLM_KV_TOKENIZER_MIDDLE_ID,430 431 // sentence-transformers dense layers in and out features432 LLM_KV_DENSE_2_FEAT_IN,433 LLM_KV_DENSE_2_FEAT_OUT,434 LLM_KV_DENSE_3_FEAT_IN,435 LLM_KV_DENSE_3_FEAT_OUT,436};437 438enum llm_tensor {439 LLM_TENSOR_TOKEN_EMBD,440 LLM_TENSOR_TOKEN_EMBD_NORM,441 LLM_TENSOR_TOKEN_TYPES,442 LLM_TENSOR_POS_EMBD,443 LLM_TENSOR_DENSE_2_OUT,444 LLM_TENSOR_DENSE_3_OUT,445 LLM_TENSOR_OUTPUT,446 LLM_TENSOR_OUTPUT_NORM,447 LLM_TENSOR_OUTPUT_NORM_LFM2, // fix for wrong tensor name448 LLM_TENSOR_ROPE_FREQS,449 LLM_TENSOR_ROPE_FACTORS_LONG,450 LLM_TENSOR_ROPE_FACTORS_SHORT,451 LLM_TENSOR_ATTN_Q,452 LLM_TENSOR_ATTN_K,453 LLM_TENSOR_ATTN_V,454 LLM_TENSOR_ATTN_QKV,455 LLM_TENSOR_ATTN_OUT,456 LLM_TENSOR_ATTN_NORM,457 LLM_TENSOR_ATTN_NORM_2,458 LLM_TENSOR_ATTN_OUT_NORM,459 LLM_TENSOR_ATTN_POST_NORM,460 LLM_TENSOR_ATTN_ROT_EMBD,461 LLM_TENSOR_ATTN_SINKS,462 LLM_TENSOR_ATTN_GATE,463 LLM_TENSOR_FFN_GATE_INP,464 LLM_TENSOR_FFN_GATE_INP_SHEXP,465 LLM_TENSOR_FFN_NORM,466 LLM_TENSOR_FFN_POST_NORM,467 LLM_TENSOR_FFN_POST_NORM_1,468 LLM_TENSOR_FFN_POST_NORM_2,469 LLM_TENSOR_FFN_PRE_NORM_2,470 LLM_TENSOR_FFN_GATE,471 LLM_TENSOR_FFN_DOWN,472 LLM_TENSOR_FFN_UP,473 LLM_TENSOR_FFN_ACT,474 LLM_TENSOR_FFN_DOWN_EXP, // split experts for backward compatibility475 LLM_TENSOR_FFN_GATE_EXP,476 LLM_TENSOR_FFN_UP_EXP,477 LLM_TENSOR_FFN_NORM_EXPS,478 LLM_TENSOR_FFN_DOWN_EXPS, // merged experts479 LLM_TENSOR_FFN_GATE_EXPS,480 LLM_TENSOR_FFN_UP_EXPS,481 LLM_TENSOR_FFN_GATE_UP_EXPS,482 LLM_TENSOR_FFN_DOWN_SHEXP,483 LLM_TENSOR_FFN_GATE_SHEXP,484 LLM_TENSOR_FFN_UP_SHEXP,485 LLM_TENSOR_FFN_DOWN_CHEXPS,486 LLM_TENSOR_FFN_GATE_CHEXPS,487 LLM_TENSOR_FFN_UP_CHEXPS,488 LLM_TENSOR_FFN_EXP_PROBS_B,489 LLM_TENSOR_FFN_EXP_PROBS_B_VL,490 LLM_TENSOR_FFN_LATENT_DOWN,491 LLM_TENSOR_FFN_LATENT_UP,492 LLM_TENSOR_ATTN_Q_NORM,493 LLM_TENSOR_ATTN_K_NORM,494 LLM_TENSOR_LAYER_OUT_NORM,495 LLM_TENSOR_LAYER_OUT_SCALE,496 LLM_TENSOR_POST_ATTN_NORM,497 LLM_TENSOR_POST_MLP_NORM,498 LLM_TENSOR_PER_LAYER_TOKEN_EMBD, // gemma3n499 LLM_TENSOR_PER_LAYER_MODEL_PROJ, // gemma3n500 LLM_TENSOR_PER_LAYER_INP_GATE, // gemma3n501 LLM_TENSOR_PER_LAYER_PROJ, // gemma3n502 LLM_TENSOR_PER_LAYER_PROJ_NORM, // gemma3n503 LLM_TENSOR_PER_LAYER_POST_NORM, // gemma3n504 LLM_TENSOR_ALTUP_PROJ, // gemma3n505 LLM_TENSOR_ALTUP_UNEMBD_PROJ, // gemma3n506 LLM_TENSOR_ALTUP_CORRECT_COEF, // gemma3n507 LLM_TENSOR_ALTUP_CORRECT_SCALE, // gemma3n508 LLM_TENSOR_ALTUP_PREDICT_COEF, // gemma3n509 LLM_TENSOR_ALTUP_ROUTER, // gemma3n510 LLM_TENSOR_ALTUP_ROUTER_NORM, // gemma3n511 LLM_TENSOR_LAUREL_L, // gemma3n512 LLM_TENSOR_LAUREL_R, // gemma3n513 LLM_TENSOR_LAUREL_POST_NORM, // gemma3n514 LLM_TENSOR_SSM_IN,515 LLM_TENSOR_SSM_CONV1D,516 LLM_TENSOR_SSM_X,517 LLM_TENSOR_SSM_DT,518 LLM_TENSOR_SSM_DT_NORM,519 LLM_TENSOR_SSM_A,520 LLM_TENSOR_SSM_A_NOSCAN, // qwen3next special case with MUL instead of SSM_SCAN521 LLM_TENSOR_SSM_B_NORM,522 LLM_TENSOR_SSM_C_NORM,523 LLM_TENSOR_SSM_D,524 LLM_TENSOR_SSM_NORM,525 LLM_TENSOR_SSM_OUT,526 LLM_TENSOR_SSM_BETA_ALPHA, // qwen3next527 LLM_TENSOR_SSM_ALPHA, // qwen3.5528 // Kimi Linear KDA (using SSM_ prefix for consistency)529 LLM_TENSOR_SSM_CONV1D_Q, // kimi: Q conv1d weight530 LLM_TENSOR_SSM_CONV1D_K, // kimi: K conv1d weight531 LLM_TENSOR_SSM_CONV1D_V, // kimi: V conv1d weight532 LLM_TENSOR_SSM_F_A, // kimi: forget gate projection A533 LLM_TENSOR_SSM_F_B, // kimi: forget gate projection B534 LLM_TENSOR_SSM_BETA, // kimi: beta mixing coefficient and qwen3.5535 LLM_TENSOR_SSM_G_A, // kimi: output gate projection A536 LLM_TENSOR_SSM_G_B, // kimi: output gate projection B537 LLM_TENSOR_SSM_G, // kimi-k3: full-rank KDA gate538 LLM_TENSOR_ATTN_RES_SCORE, // kimi-k3: fused res_norm*res_proj (pre-attn)539 LLM_TENSOR_FFN_RES_SCORE, // kimi-k3: fused res_norm*res_proj (pre-ffn)540 LLM_TENSOR_OUTPUT_RES_SCORE, // kimi-k3: fused res_norm*res_proj (final)541 LLM_TENSOR_FFN_ROUTED_DOWN, // kimi-k3: latent MoE down542 LLM_TENSOR_FFN_ROUTED_UP, // kimi-k3: latent MoE up543 LLM_TENSOR_FFN_ROUTED_NORM, // kimi-k3: latent MoE norm544 LLM_TENSOR_TIME_MIX_W0,545 LLM_TENSOR_TIME_MIX_W1,546 LLM_TENSOR_TIME_MIX_W2,547 LLM_TENSOR_TIME_MIX_A0,548 LLM_TENSOR_TIME_MIX_A1,549 LLM_TENSOR_TIME_MIX_A2,550 LLM_TENSOR_TIME_MIX_V0,551 LLM_TENSOR_TIME_MIX_V1,552 LLM_TENSOR_TIME_MIX_V2,553 LLM_TENSOR_TIME_MIX_G1,554 LLM_TENSOR_TIME_MIX_G2,555 LLM_TENSOR_TIME_MIX_K_K,556 LLM_TENSOR_TIME_MIX_K_A,557 LLM_TENSOR_TIME_MIX_R_K,558 LLM_TENSOR_TIME_MIX_LERP_X,559 LLM_TENSOR_TIME_MIX_LERP_W,560 LLM_TENSOR_TIME_MIX_LERP_K,561 LLM_TENSOR_TIME_MIX_LERP_V,562 LLM_TENSOR_TIME_MIX_LERP_R,563 LLM_TENSOR_TIME_MIX_LERP_G,564 LLM_TENSOR_TIME_MIX_LERP_FUSED,565 LLM_TENSOR_TIME_MIX_FIRST,566 LLM_TENSOR_TIME_MIX_DECAY,567 LLM_TENSOR_TIME_MIX_DECAY_W1,568 LLM_TENSOR_TIME_MIX_DECAY_W2,569 LLM_TENSOR_TIME_MIX_KEY,570 LLM_TENSOR_TIME_MIX_VALUE,571 LLM_TENSOR_TIME_MIX_RECEPTANCE,572 LLM_TENSOR_TIME_MIX_GATE,573 LLM_TENSOR_TIME_MIX_LN,574 LLM_TENSOR_TIME_MIX_OUTPUT,575 LLM_TENSOR_CHANNEL_MIX_LERP_K,576 LLM_TENSOR_CHANNEL_MIX_LERP_R,577 LLM_TENSOR_CHANNEL_MIX_KEY,578 LLM_TENSOR_CHANNEL_MIX_RECEPTANCE,579 LLM_TENSOR_CHANNEL_MIX_VALUE,580 LLM_TENSOR_ATTN_Q_A,581 LLM_TENSOR_ATTN_Q_B,582 LLM_TENSOR_ATTN_KV_A_MQA,583 LLM_TENSOR_ATTN_KV_B,584 LLM_TENSOR_ATTN_KV,585 LLM_TENSOR_ATTN_KV_NORM,586 LLM_TENSOR_ATTN_OUT_A,587 LLM_TENSOR_ATTN_OUT_B,588 LLM_TENSOR_ATTN_K_B,589 LLM_TENSOR_ATTN_V_B,590 LLM_TENSOR_ATTN_Q_A_NORM,591 LLM_TENSOR_ATTN_KV_A_NORM,592 LLM_TENSOR_HC_HEAD_FN,593 LLM_TENSOR_HC_HEAD_BASE,594 LLM_TENSOR_HC_HEAD_SCALE,595 LLM_TENSOR_HC_HEAD_NORM, // qwen4exp596 LLM_TENSOR_HC_HEAD_DOWN, // qwen4exp597 LLM_TENSOR_HC_HEAD_UP, // qwen4exp598 LLM_TENSOR_HC_ATTN_FN,599 LLM_TENSOR_HC_ATTN_BASE,600 LLM_TENSOR_HC_ATTN_SCALE,601 LLM_TENSOR_HC_FFN_FN,602 LLM_TENSOR_HC_FFN_BASE,603 LLM_TENSOR_HC_FFN_SCALE,604 LLM_TENSOR_HC_ATTN_NORM, // qwen4exp605 LLM_TENSOR_HC_ATTN_DOWN, // qwen4exp606 LLM_TENSOR_HC_ATTN_UP, // qwen4exp607 LLM_TENSOR_HC_ATTN_INJECT, // qwen4exp608 LLM_TENSOR_HC_FFN_NORM, // qwen4exp609 LLM_TENSOR_HC_FFN_DOWN, // qwen4exp610 LLM_TENSOR_HC_FFN_UP, // qwen4exp611 LLM_TENSOR_HC_FFN_INJECT, // qwen4exp612 LLM_TENSOR_PLE_KEY, // qwen4exp613 LLM_TENSOR_PLE_VALUE, // qwen4exp614 LLM_TENSOR_PLE_NORM_KEY, // qwen4exp615 LLM_TENSOR_PLE_NORM_QUERY, // qwen4exp616 LLM_TENSOR_PLE_NORM_CONV, // qwen4exp617 LLM_TENSOR_PLE_CONV1D, // qwen4exp618 LLM_TENSOR_ATTN_COMPRESSOR_WKV,619 LLM_TENSOR_ATTN_COMPRESSOR_WGATE,620 LLM_TENSOR_ATTN_COMPRESSOR_APE,621 LLM_TENSOR_ATTN_COMPRESSOR_NORM,622 LLM_TENSOR_ATTN_SUB_NORM,623 LLM_TENSOR_FFN_SUB_NORM,624 LLM_TENSOR_DEC_ATTN_NORM,625 LLM_TENSOR_DEC_ATTN_Q,626 LLM_TENSOR_DEC_ATTN_K,627 LLM_TENSOR_DEC_ATTN_V,628 LLM_TENSOR_DEC_ATTN_OUT,629 LLM_TENSOR_DEC_ATTN_REL_B,630 LLM_TENSOR_DEC_CROSS_ATTN_NORM,631 LLM_TENSOR_DEC_CROSS_ATTN_Q,632 LLM_TENSOR_DEC_CROSS_ATTN_K,633 LLM_TENSOR_DEC_CROSS_ATTN_V,634 LLM_TENSOR_DEC_CROSS_ATTN_OUT,635 LLM_TENSOR_DEC_CROSS_ATTN_REL_B,636 LLM_TENSOR_DEC_FFN_NORM,637 LLM_TENSOR_DEC_FFN_GATE,638 LLM_TENSOR_DEC_FFN_DOWN,639 LLM_TENSOR_DEC_FFN_UP,640 LLM_TENSOR_DEC_OUTPUT_NORM,641 LLM_TENSOR_ENC_ATTN_NORM,642 LLM_TENSOR_ENC_ATTN_Q,643 LLM_TENSOR_ENC_ATTN_K,644 LLM_TENSOR_ENC_ATTN_V,645 LLM_TENSOR_ENC_ATTN_OUT,646 LLM_TENSOR_ENC_ATTN_REL_B,647 LLM_TENSOR_ENC_FFN_NORM,648 LLM_TENSOR_ENC_FFN_GATE,649 LLM_TENSOR_ENC_FFN_DOWN,650 LLM_TENSOR_ENC_FFN_UP,651 LLM_TENSOR_ENC_OUTPUT_NORM,652 LLM_TENSOR_CLS,653 LLM_TENSOR_CLS_OUT,654 LLM_TENSOR_CLS_NORM,655 LLM_TENSOR_CONV1D,656 LLM_TENSOR_CONVNEXT_DW,657 LLM_TENSOR_CONVNEXT_NORM,658 LLM_TENSOR_CONVNEXT_PW1,659 LLM_TENSOR_CONVNEXT_PW2,660 LLM_TENSOR_CONVNEXT_GAMMA,661 LLM_TENSOR_POS_NET_CONV1,662 LLM_TENSOR_POS_NET_CONV2,663 LLM_TENSOR_POS_NET_NORM,664 LLM_TENSOR_POS_NET_NORM1,665 LLM_TENSOR_POS_NET_NORM2,666 LLM_TENSOR_POS_NET_ATTN_NORM,667 LLM_TENSOR_POS_NET_ATTN_Q,668 LLM_TENSOR_POS_NET_ATTN_K,669 LLM_TENSOR_POS_NET_ATTN_V,670 LLM_TENSOR_POS_NET_ATTN_OUT,671 LLM_TENSOR_SHORTCONV_CONV,672 LLM_TENSOR_SHORTCONV_INPROJ,673 LLM_TENSOR_SHORTCONV_OUTPROJ,674 LLM_TENSOR_VISEXP_ATTN_QKV,675 LLM_TENSOR_VISEXP_ATTN_OUT,676 LLM_TENSOR_VISEXP_FFN_GATE,677 LLM_TENSOR_VISEXP_FFN_DOWN,678 LLM_TENSOR_VISEXP_FFN_UP,679 LLM_TENSOR_INDEXER_K_NORM,680 LLM_TENSOR_INDEXER_PROJ,681 LLM_TENSOR_INDEXER_ATTN_K,682 LLM_TENSOR_INDEXER_ATTN_Q_B,683 LLM_TENSOR_INDEXER_Q_PROJ,684 LLM_TENSOR_INDEXER_K_PROJ,685 LLM_TENSOR_INDEXER_Q_NORM,686 LLM_TENSOR_INDEXER_COMPRESSOR_WKV,687 LLM_TENSOR_INDEXER_COMPRESSOR_WGATE,688 LLM_TENSOR_INDEXER_COMPRESSOR_APE,689 LLM_TENSOR_INDEXER_COMPRESSOR_NORM,690 LLM_TENSOR_FFN_GATE_TID2EID,691 LLM_TENSOR_NEXTN_PROJ_PRE,692 LLM_TENSOR_NEXTN_PROJ_POST,693 LLM_TENSOR_NEXTN_EH_PROJ,694 LLM_TENSOR_NEXTN_EMBED_TOKENS,695 LLM_TENSOR_NEXTN_ENORM,696 LLM_TENSOR_NEXTN_HNORM,697 LLM_TENSOR_NEXTN_SHARED_HEAD_HEAD,698 LLM_TENSOR_NEXTN_SHARED_HEAD_NORM,699 LLM_TENSOR_MASKED_EMBD_CENTROIDS,700 LLM_TENSOR_MASKED_EMBD_ORDERING,701 LLM_TENSOR_HRM_Z_L_INIT,702 LLM_TENSOR_FC,703 LLM_TENSOR_D2T,704 LLM_TENSOR_DSPARK_MARKOV_W1,705 LLM_TENSOR_DSPARK_MARKOV_W2,706 LLM_TENSOR_DSPARK_CONF_PROJ,707 LLM_TENSOR_DFLASH_ATTN_CONV_BASE,708 LLM_TENSOR_DFLASH_ATTN_CONV_PROJ,709 LLM_TENSOR_DFLASH_FFN_CONV_BASE,710 LLM_TENSOR_DFLASH_FFN_CONV_PROJ,711 LLM_TENSOR_DFLASH_SELECTOR_PREV,712 LLM_TENSOR_DFLASH_SELECTOR_NEXT,713 LLM_TENSOR_DFLASH_SELECTOR_HIDDEN,714};715 716 717enum llm_tensor_layer {718 LLM_TENSOR_LAYER_INPUT,719 LLM_TENSOR_LAYER_REPEATING,720 LLM_TENSOR_LAYER_OUTPUT,721};722 723struct LLM_KV {724 LLM_KV(llm_arch arch, const char * suffix = nullptr);725 726 llm_arch arch;727 const char * suffix;728 729 std::string operator()(llm_kv kv) const;730};731 732// helper to handle gguf constants733// usage:734//735// const auto tn = LLM_TN(LLM_ARCH_LLAMA);736//737// std::string name = tn(LLM_TENSOR_OUTPUT); -> "output"738// std::string name = tn(LLM_TENSOR_TOKEN_EMBD, "bias"); -> "token_embd.bias"739// std::string name = tn(LLM_TENSOR_ATTN_NORM, "weight", 3); -> "blk.3.attn_norm.weight"740//741struct LLM_TN_IMPL {742 const llm_arch arch;743 const llm_tensor tensor;744 const char * const suffix;745 const int bid;746 const int xid;747 748 LLM_TN_IMPL(llm_arch arch, llm_tensor tensor, const char * suffix, int bid, int xid);749 750 std::string str() const;751 752 operator std::string() const {753 return str();754 }755 756 friend bool operator==(const std::string & str, const LLM_TN_IMPL & tn) {757 return str == tn.str();758 }759 760 friend bool operator!=(const std::string & str, const LLM_TN_IMPL & tn) {761 return str != tn.str();762 }763};764 765struct LLM_TN {766 LLM_TN(llm_arch arch) : arch(arch) {}767 768 llm_arch arch;769 770 LLM_TN_IMPL operator()(llm_tensor tensor, const char * suffix, int bid = -1, int xid = -1) const {771 return LLM_TN_IMPL(arch, tensor, suffix, bid, xid);772 }773 774 LLM_TN_IMPL operator()(llm_tensor tensor, int bid = -1, int xid = -1) const {775 return LLM_TN_IMPL(arch, tensor, nullptr, bid, xid);776 }777};778 779 780struct llm_tensor_info {781 llm_tensor_layer layer;782 ggml_op op;783};784 785std::vector<llm_arch> llm_arch_all();786 787const char * llm_arch_name(llm_arch arch);788 789llm_arch llm_arch_from_string(const std::string & name);790 791const llm_tensor_info & llm_tensor_info_for(llm_tensor tensor);792 793bool llm_arch_is_recurrent (const llm_arch & arch);794bool llm_arch_is_hybrid (const llm_arch & arch);795bool llm_arch_is_diffusion (const llm_arch & arch);796bool llm_arch_supports_sm_tensor(const llm_arch & arch);797bool llm_arch_supports_rs_rollback(const llm_arch & arch);798 