Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF
qwen3-0.6b-russian-dialogues-Q8_0-GGUF
Квантование Q8_0 модели ya-yje-krasni/qwen3-0.6b-russian-dialogues — полного файнтюнинга Qwen3-0.6B на русских диалогах (обучались все параметры, без LoRA и адаптеров).
Конвертировано в GGUF через llama.cpp с помощью GGUF-my-repo.
Более компактная версия: Q4_K_M (397 МБ).
Формат промпта
Модель обучена на шаблоне с явным маркером ответа, а не на chat template:
<реплика пользователя>
### Ответ:Генерация продолжает текст после ### Ответ:. Поэтому используйте обычное дополнение текста (llama-cli, /completion), а не чат-эндпоинт.
Запуск через llama.cpp
Установка (macOS и Linux):
brew install llama.cppОдиночная генерация напрямую из Hub:
llama-cli --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF \
--hf-file qwen3-0.6b-russian-dialogues-q8_0.gguf \
-p $'Привет, как дела?\n### Ответ:' -n 128 --no-display-promptЛокальный сервер с OpenAI-совместимым API:
llama-server --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF \
--hf-file qwen3-0.6b-russian-dialogues-q8_0.gguf -c 4096Скачать файл заранее:
pip install -U "huggingface_hub[cli]"
hf download Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF \
qwen3-0.6b-russian-dialogues-q8_0.gguf --local-dir .Код и скрипты
Готовые скрипты запуска и конфиги: github.com/lev73748/qwen3-0.6b-russian-dialogues
Ограничения
Модель на 0.6B параметров — ответы короткие, разговорные, факты могут быть неверными. Не подходит для задач, требующих точности. Q8_0 почти не теряет качества относительно исходных весов, но занимает 639 МБ.
