Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS-GGUF (любительская сборка)
📌 Что это
Квантованная версия IQ3_XXS модели HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive в формате GGUF.
Сборка создана для личного использования на NVIDIA GeForce GTX 1080 (8 ГБ VRAM) и публикуется «как есть». Все приведённые ниже цифры получены на конкретной тестовой системе; на других конфигурациях поведение может отличаться.
⚠️ Любительская сборка. Тестировалась только на указанной конфигурации.
📦 Состав репозитория
В авторском репозитории HauhauCS отсутствуют 3-битные кванты. Минимальный размер там — Q4_K_M (5,3 ГБ). Квант Q3_K_L (4,58 ГБ) был получен в ходе экспериментов, но не публикуется из-за худшего соотношения качество/память на целевом домене.
🖥️ Тестовая конфигурация
🔬 Детали квантизации
Калибровочный датасет (imatrix)
Использовался файл imatrix.dat (~1 МБ) со следующей структурой:
Сам файл imatrix.dat не публикуется.
Стратегия сжатия слоёв
Средний битрейт модели: 3,51 bpw.
📊 Результаты тестов
Производительность
Пиковые значения prompt eval достигали 581 t/s. Скорость генерации стабильна в районе 30–35 t/s.
Потребление видеопамяти (контекст ~2k)
Сравнение с другими квантами
Гибридный датасет — смесь кода, логических задач и текстов на русском/английском, близкая к калибровочному набору.
🧠 Тестирование длинного контекста (32k)
Модель протестирована с --ctx-size 32768 на задаче «иголка в стоге сена». Использовался отрывок из романа «Война и мир» (~37 400 токенов). В середину текста вставлена фраза: «Внезапно в комнату вошёл розовый слон и вежливо поздоровался с Анной Павловной». Модель успешно извлекла и воспроизвела эту информацию.
Важно:
- Тест проведён на художественном тексте. На сложных технических или специализированных материалах качество работы с 32k контекстом может варьироваться.
- Модель может «плыть» при ответах, требующих синтеза информации из разных частей длинного документа.
Рекомендация: для гарантированно стабильной работы используйте контекст до 16k токенов.
🖼️ Мультимодальность
Модель поддерживает работу с изображениями (проверено в llama.cpp).
Важно: на видеокартах с 8 ГБ VRAM обязателен флаг --no-mmproj-offload, иначе возникнет ошибка cudaMalloc failed: out of memory.
Поддержка видео заявлена архитектурой, но не тестировалась.
🚀 Инструкции по запуску
1. Текстовый режим (llama.cpp)
Базовая команда:
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
-ngl 99 \
--temp 0.7 \
-n 2048 \
-p "Ваш запрос"
С отключением размышлений (рекомендуется):
Создайте файл no-think.jinja со следующим содержимым:
jinja
{{ bos_token }}
{% for message in messages %}
{% if message['role'] == 'user' %}
<|im_start|>user
{{ message['content'] }}<|im_end|>
{% elif message['role'] == 'assistant' %}
<|im_start|>assistant
{{ message['content'] }}<|im_end|>
{% elif message['role'] == 'system' %}
<|im_start|>system
{{ message['content'] }}<|im_end|>
{% endif %}
{% endfor %}
{% if add_generation_prompt %}
<|im_start|>assistant
{% endif %}
И запускайте модель с флагом --chat-template-file:
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--chat-template-file no-think.jinja \
-ngl 99 \
--temp 0.7 \
-n 2048 \
-p "Ваш запрос"
Творческий режим (генерация идей, написание текстов):
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--chat-template-file no-think.jinja \
-ngl 99 \
--temp 1.0 --top-p 1.0 --top-k 40 \
--repeat-penalty 1.1 \
-n 2048 \
-p "Ваш запрос"
Режим точных ответов (логика, код, факты):
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--chat-template-file no-think.jinja \
-ngl 99 \
--temp 0.6 --top-p 0.95 --top-k 20 \
-n 2048 \
-p "Ваш запрос"
2. Мультимодальный режим (llama.cpp)
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--mmproj ./models/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
--image your_image.png \
--chat-template-file no-think.jinja \
-ngl 99 \
--no-mmproj-offload \
-n 2048 \
-p "Опиши подробно, что изображено на этой картинке."
3. Использование с Ollama (только текст)
Текстовая совместимость с Ollama проверена. Создайте файл Modelfile:
dockerfile
FROM ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
"""
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
PARAMETER repeat_penalty 1.1
PARAMETER stop "<|im_start|>"
PARAMETER stop "<|im_end|>"
Импортируйте и запустите модель:
bash
ollama create qwen35-iq3xxs -f Modelfile
ollama run qwen35-iq3xxs "Ваш запрос"
Мультимодальность в Ollama не поддерживается (проверено на актуальной версии). Для работы с изображениями используйте llama.cpp.
⬇️ Быстрая загрузка всех файлов
Чтобы скачать модель, mmproj, шаблон и Modelfile одной командой:
bash
curl -L -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
-O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
-O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/no-think.jinja \
-O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Modelfile
⚠️ Ограничения и известные проблемы
Единственная тестовая система: все замеры на GTX 1080. На других GPU поведение может отличаться.
Длинный контекст: модель прошла тест «иголка в стоге сена», но на сложных технических текстах качество не гарантируется.
Мультимодальность в Ollama: не работает. Используйте llama.cpp.
Качество на чистом тексте: немного уступает Q3_K_L (WikiText-2), но на смешанных данных с кодом и логикой превосходит его.
❓ FAQ
Q: Почему выложен только IQ3_XXS, а не Q3_K_L?
A: Q3_K_L на гибридном домене показал худшее качество при большем размере.
Q: Где взять mmproj?
A: Файл включён в репозиторий. Также доступен в оригинальном репозитории.
Q: Будет ли модель работать на Windows?
A: Да, через llama.cpp или LM Studio. Команды адаптируются.
📄 Лицензия
Apache License 2.0 (соответствует оригинальной модели).
🙏 Благодарности
HauhauCS — за оригинальную модель.
Команда llama.cpp — за инструменты квантизации и инференса.
