Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF
qwen3-0.6b-russian-dialogues-Q4KM-GGUF
Квантование Q4KM модели ya-yje-krasni/qwen3-0.6b-russian-dialogues — полного файнтюнинга Qwen3-0.6B на русских диалогах (обучались все параметры, без LoRA и адаптеров).
Конвертировано в GGUF через llama.cpp с помощью GGUF-my-repo.
Более точная версия: Q8_0 (639 МБ).
Формат промпта
Модель обучена на шаблоне с явным маркером ответа, а не на chat template:
<реплика пользователя>
### Ответ:Генерация продолжает текст после ### Ответ:. Поэтому используйте обычное дополнение текста (llama-cli, /completion), а не чат-эндпоинт.
Запуск через llama.cpp
Установка (macOS и Linux):
brew install llama.cppОдиночная генерация напрямую из Hub:
llama-cli --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF \
--hf-file qwen3-0.6b-russian-dialogues-q4_k_m.gguf \
-p $'Привет, как дела?\n### Ответ:' -n 128 --no-display-promptЛокальный сервер с OpenAI-совместимым API:
llama-server --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF \
--hf-file qwen3-0.6b-russian-dialogues-q4_k_m.gguf -c 4096Скачать файл заранее:
pip install -U "huggingface_hub[cli]"
hf download Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF \
qwen3-0.6b-russian-dialogues-q4_k_m.gguf --local-dir .Код и скрипты
Готовые скрипты запуска и конфиги: github.com/lev73748/qwen3-0.6b-russian-dialogues
Ограничения
Модель на 0.6B параметров плюс 4-битное квантование — ответы короткие, разговорные, факты могут быть неверными. Не подходит для задач, требующих точности.
