GOBA-AI-Labs/PrunedHub-GPT-OSS-20B-28x
1352
PrunedHub GPT-OSS-20B-28x
Lossless MoE Expert Pruning — 12.5% of experts removed with zero quality loss.
Pruned from OpenAI GPT-OSS-20B using GOBA-AI-Labs' proprietary expert optimization methodology.
Model Details
Benchmark Results
*GSM8K original baseline measured with reasoning budget constraints.
Size Comparison
Key Features
- Lossless compression — Zero quality degradation across all benchmarks
- Drop-in replacement — Compatible with llama.cpp (build 7970+)
- Fits 16GB RAM — With room for KV cache at 4K context
- ~55 tok/s on Apple M4 Pro (Metal GPU)
Usage
llama.cpp (recommended)
This model uses uniform expert counts and is fully compatible with llama.cpp:
llama-server -m PrunedHub-GPT-OSS-20B-28x-Q4_K_M.gguf --port 8090 -ngl 99 -c 4096moe-stream
Also supported by moe-stream, which offers GPU-resident inference and OpenAI-compatible HTTP API:
# CLI inference
moe-stream PrunedHub-GPT-OSS-20B-28x-Q4_K_M.gguf 512 \
--prompt "Explain quantum computing" --stream
# OpenAI-compatible HTTP server
moe-stream-server --model PrunedHub-GPT-OSS-20B-28x-Q4_K_M.gguf --port 11434Methodology
This model was created using GOBA-AI-Labs' expert optimization pipeline:
- Calibration-based importance scoring: Expert importance is measured through actual inference behavior on diverse workloads, not just weight magnitude statistics. This produces significantly more accurate importance rankings than static analysis
- Layer-adaptive expert allocation: Each MoE layer retains a dynamically determined number of experts based on its measured contribution to model quality, rather than applying a uniform pruning ratio across all layers
- Cross-model validation: The pruning methodology has been validated across multiple MoE architectures (GPT-OSS-20B, Qwen3-30B-A3B, Qwen3-Coder-Next-80B) with consistent results
Citation
@misc{goba-ai-labs-prunedhub-gptoss-28x,
title={PrunedHub GPT-OSS-20B-28x: Lossless MoE Expert Pruning},
author={GOBA-AI-Labs},
year={2026},
url={https://huggingface.co/GOBA-AI-Labs/PrunedHub-GPT-OSS-20B-28x}
}Links
- GOBA AI Labs — project website
- moe-stream — inference engine
- GOBA-AI-Labs on HuggingFace
- Base Model: GPT-OSS-20B
- Support GOBA-AI-Labs on Ko-fi
