teamblobfish/DeepSeek-V4-Pro-GGUF
README: drop multi-GPU caveats list (kept recommended config)
README: add WIP multi-GPU CUDA section with recommended layer-split config
README: CUDA build — add SM table, BUILD_TYPE=Release, multi-GPU needs both CXX+CUDA flags
README: drop #21149 gate reference, lead with fork install
README: correct -cmoe technical explanation (op_offload + peak-liveness compute buffer) per codex audit
README: document -cmoe + -ub 128 recommendation (fairydreaming's RTX PRO 6000 OOM report)
README: document -DGGML_SCHED_MAX_SPLIT_INPUTS=128 flag for multi-GPU CUDA builds
README: CUDA support landed (19/19 on RTX 5090), branch renamed to feat/v4-port-cuda
Add Q8_0 shards
Add Q4_K_M-XL shards
README: Q2_K-XL gate-tools ✓ pass; add real timing numbers
Add Q2_K-XL shards
README: explicit CUDA / non-Metal backends not supported (Metal-only ops)
Add README
Add DSML chat template
initial commit
