kirilldual0987/MIXdevAI-yandexGPT5-8B-GGUF
0603
MIXdevAI-yandexGPT5-8B-GGUF
Full set of GGUF quantizations for Kolyadual/MIXdevAI-yandexGPT5-8B.
Files
Quantization notes
- Q8_0 / F16: Almost lossless. Best quality, largest size.
- Q6_K / Q5_K_M: Excellent balance between quality and size.
- Q4_K_M: Golden standard for local inference.
- Q3_K_M / Q2_K: Noticeable quality degradation. Use only if you have severe RAM/VRAM constraints.
How to run locally
Example using llama.cpp server:
llama-server \
-m mixdev-ya-q4_k_m.gguf \
-ngl 999 \
--host 0.0.0.0 --port 8080 \
-c 32768