CoolFace
Modelpublic

Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF

sourceHugging Faceapache-2.0updated 29d agoView on Hugging Face
1likes166downloads
Model Card

qwen3-0.6b-russian-dialogues-Q4KM-GGUF

Квантование Q4KM модели ya-yje-krasni/qwen3-0.6b-russian-dialogues — полного файнтюнинга Qwen3-0.6B на русских диалогах (обучались все параметры, без LoRA и адаптеров).

Конвертировано в GGUF через llama.cpp с помощью GGUF-my-repo.

КвантованиеQ4KM
Размер файла397 МБ
Исходная модельya-yje-krasni/qwen3-0.6b-russian-dialogues (float32, 2.4 ГБ)
Базовая модельQwen/Qwen3-0.6B
ДатасетDen4ikAI/russian_dialogues
Контекст32 768 токенов
Языкрусский
ЛицензияApache 2.0

Более точная версия: Q8_0 (639 МБ).

Формат промпта

Модель обучена на шаблоне с явным маркером ответа, а не на chat template:

<реплика пользователя>
### Ответ:

Генерация продолжает текст после ### Ответ:. Поэтому используйте обычное дополнение текста (llama-cli, /completion), а не чат-эндпоинт.

Запуск через llama.cpp

Установка (macOS и Linux):

bash
brew install llama.cpp

Одиночная генерация напрямую из Hub:

bash
llama-cli --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF \
  --hf-file qwen3-0.6b-russian-dialogues-q4_k_m.gguf \
  -p $'Привет, как дела?\n### Ответ:' -n 128 --no-display-prompt

Локальный сервер с OpenAI-совместимым API:

bash
llama-server --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF \
  --hf-file qwen3-0.6b-russian-dialogues-q4_k_m.gguf -c 4096

Скачать файл заранее:

bash
pip install -U "huggingface_hub[cli]"
hf download Lev384501/qwen3-0.6b-russian-dialogues-Q4_K_M-GGUF \
  qwen3-0.6b-russian-dialogues-q4_k_m.gguf --local-dir .

Код и скрипты

Готовые скрипты запуска и конфиги: github.com/lev73748/qwen3-0.6b-russian-dialogues

Ограничения

Модель на 0.6B параметров плюс 4-битное квантование — ответы короткие, разговорные, факты могут быть неверными. Не подходит для задач, требующих точности.