dariprim/yandexgpt-5-lite-finetuned-gguf
0195
YandexGPT-5-Lite-8B-instruct GGUF
Дообученная и слитая модель YandexGPT-5-Lite-8B-instruct в формате GGUF (GPTQ Unified Format) с полной 4-битной квантизацией.
Важно: Это полная модель, готовая к использованию. LoRA адаптеры уже объединены (merged) в веса базовой модели.
Описание
- Исходная модель:
yandex/YandexGPT-5-Lite-8B-instruct - Размер: 8 миллиардов параметров
- Формат: GGUF (можно запустить на CPU/GPU через llama.cpp и совместимые инструменты)
- Квантизация: 4-bit (Q4KM)
- Язык: русский
- Размер файла: ~4.9 GB
Что содержит этот репозиторий
Основной файл модели
- models/model.gguf (4.92 GB)
- Полная дообученная модель в GGUF формате
- LoRA адаптеры уже объединены с базовой моделью
- Готова к немедленному использованию
- Поддерживает запуск на CPU и GPU
Вспомогательные файлы
- tokenizer.json (18 MB)
- Сохраненный токенизатор из модели
- Необходим для корректной токенизации текста
- tokenizer_config.json (15 MB)
- Конфигурация токенизатора
- Параметры обработки текста
- chat_template.jinja
- Шаблон форматирования для диалога
- Специфичен для YandexGPT-5-Lite
- config.json
- Конфигурация архитектуры модели
- Параметры слоёв, внимания и т.д.
- generation_config.json
- Параметры генерации по умолчанию
- maxnewtokens, temperature, top_p и т.д.
Как использовать
Вариант 1: llama.cpp (самый быстрый способ)
# Установить llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make
# Скачать модель с Hub
huggingface-cli download dariprim/yandexgpt-5-lite-finetuned-gguf models/model.gguf
# Запустить интерактивный режим
./main -m models/model.gguf -n 256 -c 2048 --temp 0.7 -iВариант 2: Ollama
# Установить Ollama из https://ollama.ai
# Создать Modelfile
cat > Modelfile <<'MODELFILE'
FROM models/model.gguf
TEMPLATE """Вопрос: {{.Prompt}}
Ответ:"""
MODELFILE
# Создать модель
ollama create yandexgpt -f Modelfile
# Запустить
ollama run yandexgpt "Как мне справиться с тревогой?"Вариант 3: Python с llama-cpp-python
from llama_cpp import Llama
model = Llama(
model_path="models/model.gguf",
n_gpu_layers=-1, # использовать GPU
n_ctx=2048,
verbose=False,
)
prompt = "Вопрос: Как мне справиться с тревогой?\nОтвет:"
response = model(prompt, max_tokens=256, temperature=0.7)
print(response['choices'][0]['text'])Установить зависимость:
pip install llama-cpp-pythonВариант 4: ctransformers (для LangChain)
from ctransformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
"dariprim/yandexgpt-5-lite-finetuned-gguf",
model_file="models/model.gguf",
model_type="llama",
gpu_layers=50, # Use GPU if available
)
prompt = "Вопрос: Как мне справиться с тревогой?\nОтвет:"
result = model(prompt, max_new_tokens=256, temperature=0.7)
print(result)Сравнение с LoRA версией
LoRA версия: https://huggingface.co/dariprim/yandexgpt-5-lite-finetuned
Технические детали
Процесс создания
- Дообучение (train.py):
- Базовая модель:
yandex/YandexGPT-5-Lite-8B-instruct - 4-bit quantization (bitsandbytes)
- LoRA адаптеры на слоях внимания (qproj, kproj, vproj, oproj)
- Датасет: вопросы/ответы психологического характера
- Слияние (mergeandsave.py):
- LoRA адаптеры объединены с базовой моделью
- Результат сохранен в стандартном формате
- Конвертация в GGUF (converttogguf.py):
- Преобразование в формат GGUF
- 4-bit квантизация (Q4KM)
- Оптимизация для inference
Параметры квантизации
- Метод: Q4KM (средний компромисс между качеством и скоростью)
- Количество бит: 4 бита на параметр
- Экономия памяти: ~75% от оригинального размера
- Потеря качества: минимальная (~1-2%)
Производительность
На MacBook Pro M1/M2 (16GB RAM):
- Токен в секунду: ~5-10 tok/s (в зависимости от длины контекста)
- Первый токен: ~0.5-1.0 сек
- Контекст: до 2048 токенов
На NVIDIA GPU (RTX 4090):
- Токен в секунду: ~100+ tok/s
- Первый токен: ~50-100 мс
Лицензия
Следует лицензии исходной модели yandex/YandexGPT-5-Lite-8B-instruct.
Рекомендации
- Требуется минимум 8 GB RAM для llama.cpp с GPU ускорением
- Используйте GPU для лучшей производительности
- Входной контекст: до 2048 токенов
- Рекомендуемые параметры: temperature=0.7, top_p=0.9
Дополнительные ссылки
- LoRA адаптер: https://huggingface.co/dariprim/yandexgpt-5-lite-finetuned
- llama.cpp: https://github.com/ggerganov/llama.cpp
- Ollama: https://ollama.ai
- llama-cpp-python: https://github.com/abetlen/llama-cpp-python
