liodon-ai/Riva-Translate-4B-Instruct-v2-imatrix-GGUF
02.1k
Riva-Translate-4B-Instruct-v2 — iMatrix GGUF
GGUF quantizations of nvidia/Riva-Translate-4B-Instruct-v2, published by Liodon AI.
Quick Start
llama.cpp
llama-cli -hf liodon-ai/Riva-Translate-4B-Instruct-v2-imatrix-GGUF:Q4_K_MOllama
ollama run hf.co/liodon-ai/Riva-Translate-4B-Instruct-v2-imatrix-GGUF:Q4_K_MLM Studio / Jan — search liodon-ai/Riva-Translate-4B-Instruct-v2-imatrix-GGUF and pick your quant.
Quants
What is iMatrix?
Standard quantization treats all weights equally. iMatrix runs 128 calibration chunks through the full-precision model to find which weights matter most, then allocates more precision where it counts. At Q2/Q3/Q4 this means noticeably better coherence and instruction-following — same file size, better output.
Calibration: 2M tokens of WikiText-103.
Also see plain (non-iMatrix) quants: liodon-ai/Riva-Translate-4B-Instruct-v2-GGUFSource
- Model: nvidia/Riva-Translate-4B-Instruct-v2
- License: other
Quantized by [Liodon AI](https://huggingface.co/liodon-ai)
