CoolFace
Modelpublic

Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF

sourceHugging Faceapache-2.0updated 29d agoView on Hugging Face
1likes158downloads
Model Card

qwen3-0.6b-russian-dialogues-Q8_0-GGUF

Квантование Q8_0 модели ya-yje-krasni/qwen3-0.6b-russian-dialogues — полного файнтюнинга Qwen3-0.6B на русских диалогах (обучались все параметры, без LoRA и адаптеров).

Конвертировано в GGUF через llama.cpp с помощью GGUF-my-repo.

КвантованиеQ8_0
Размер файла639 МБ
Исходная модельya-yje-krasni/qwen3-0.6b-russian-dialogues (float32, 2.4 ГБ)
Базовая модельQwen/Qwen3-0.6B
ДатасетDen4ikAI/russian_dialogues
Контекст32 768 токенов
Языкрусский
ЛицензияApache 2.0

Более компактная версия: Q4_K_M (397 МБ).

Формат промпта

Модель обучена на шаблоне с явным маркером ответа, а не на chat template:

<реплика пользователя>
### Ответ:

Генерация продолжает текст после ### Ответ:. Поэтому используйте обычное дополнение текста (llama-cli, /completion), а не чат-эндпоинт.

Запуск через llama.cpp

Установка (macOS и Linux):

bash
brew install llama.cpp

Одиночная генерация напрямую из Hub:

bash
llama-cli --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF \
  --hf-file qwen3-0.6b-russian-dialogues-q8_0.gguf \
  -p $'Привет, как дела?\n### Ответ:' -n 128 --no-display-prompt

Локальный сервер с OpenAI-совместимым API:

bash
llama-server --hf-repo Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF \
  --hf-file qwen3-0.6b-russian-dialogues-q8_0.gguf -c 4096

Скачать файл заранее:

bash
pip install -U "huggingface_hub[cli]"
hf download Lev384501/qwen3-0.6b-russian-dialogues-Q8_0-GGUF \
  qwen3-0.6b-russian-dialogues-q8_0.gguf --local-dir .

Код и скрипты

Готовые скрипты запуска и конфиги: github.com/lev73748/qwen3-0.6b-russian-dialogues

Ограничения

Модель на 0.6B параметров — ответы короткие, разговорные, факты могут быть неверными. Не подходит для задач, требующих точности. Q8_0 почти не теряет качества относительно исходных весов, но занимает 639 МБ.