Vaultek/Quartz-R1-8B-Genesis-GGUF
099
Квантизованная версия Quartz-R1-8B-Genesis. Информация о модели доступна в основном репозитории: `Quartz-R1-8B-Genesis`.
Использование с помощью llama.cpp
Для начала нужно собрать llama.cpp (или обновить, если уже есть):
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
cd ..Запуск модели в интерактивном режиме:
llama.cpp/build/bin/llama-cli -m quartz_r1_genesis_clean.Q4_K_M.gguf -c 32768 -np 4Запуск сервера:
llama.cpp/build/bin/llama-server -m quartz_r1_genesis_clean.Q4_K_M.gguf -c 32768 -np 4Если позволяют ресурсы, можно ускорить инференс, добавив -t 10.
Квантизации и их качество
Вот созданный ikawrakow график, сравнивающий квантизации (на его странице, но данные совпадают) types (lower is better):

And here are Artefact2's thoughts on the matter: https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9
