CoolFace
Modelpublic

dariprim/yandexgpt-5-lite-finetuned-gguf

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes195downloads
Model Card

YandexGPT-5-Lite-8B-instruct GGUF

Дообученная и слитая модель YandexGPT-5-Lite-8B-instruct в формате GGUF (GPTQ Unified Format) с полной 4-битной квантизацией.

Важно: Это полная модель, готовая к использованию. LoRA адаптеры уже объединены (merged) в веса базовой модели.

Описание

  • —Исходная модель: yandex/YandexGPT-5-Lite-8B-instruct
  • —Размер: 8 миллиардов параметров
  • —Формат: GGUF (можно запустить на CPU/GPU через llama.cpp и совместимые инструменты)
  • —Квантизация: 4-bit (Q4KM)
  • —Язык: русский
  • —Размер файла: ~4.9 GB

Что содержит этот репозиторий

Основной файл модели

  • —models/model.gguf (4.92 GB)
  • —Полная дообученная модель в GGUF формате
  • —LoRA адаптеры уже объединены с базовой моделью
  • —Готова к немедленному использованию
  • —Поддерживает запуск на CPU и GPU

Вспомогательные файлы

  • —tokenizer.json (18 MB)
  • —Сохраненный токенизатор из модели
  • —Необходим для корректной токенизации текста
  • —tokenizer_config.json (15 MB)
  • —Конфигурация токенизатора
  • —Параметры обработки текста
  • —chat_template.jinja
  • —Шаблон форматирования для диалога
  • —Специфичен для YandexGPT-5-Lite
  • —config.json
  • —Конфигурация архитектуры модели
  • —Параметры слоёв, внимания и т.д.
  • —generation_config.json
  • —Параметры генерации по умолчанию
  • —maxnewtokens, temperature, top_p и т.д.

Как использовать

Вариант 1: llama.cpp (самый быстрый способ)

bash
# Установить llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

# Скачать модель с Hub
huggingface-cli download dariprim/yandexgpt-5-lite-finetuned-gguf models/model.gguf

# Запустить интерактивный режим
./main -m models/model.gguf -n 256 -c 2048 --temp 0.7 -i

Вариант 2: Ollama

bash
# Установить Ollama из https://ollama.ai
# Создать Modelfile
cat > Modelfile <<'MODELFILE'
FROM models/model.gguf
TEMPLATE """Вопрос: {{.Prompt}}
Ответ:"""
MODELFILE

# Создать модель
ollama create yandexgpt -f Modelfile

# Запустить
ollama run yandexgpt "Как мне справиться с тревогой?"

Вариант 3: Python с llama-cpp-python

python
from llama_cpp import Llama

model = Llama(
    model_path="models/model.gguf",
    n_gpu_layers=-1,  # использовать GPU
    n_ctx=2048,
    verbose=False,
)

prompt = "Вопрос: Как мне справиться с тревогой?\nОтвет:"
response = model(prompt, max_tokens=256, temperature=0.7)
print(response['choices'][0]['text'])

Установить зависимость:

bash
pip install llama-cpp-python

Вариант 4: ctransformers (для LangChain)

python
from ctransformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained(
    "dariprim/yandexgpt-5-lite-finetuned-gguf",
    model_file="models/model.gguf",
    model_type="llama",
    gpu_layers=50,  # Use GPU if available
)

prompt = "Вопрос: Как мне справиться с тревогой?\nОтвет:"
result = model(prompt, max_new_tokens=256, temperature=0.7)
print(result)

Сравнение с LoRA версией

ХарактеристикаLoRA версияGGUF версия
Размер47 MB (адаптер)4.9 GB (полная)
Использование памяти4-5 GB (с базовой)~2-3 GB
Скорость инференсаМедленнееБыстрее (Q4)
СовместимостьHuggingFace трансформерыllama.cpp, Ollama, и т.д.
Требует базовую модельДаНет
Замораживание весовДа (LoRA)Нет (merged)

LoRA версия: https://huggingface.co/dariprim/yandexgpt-5-lite-finetuned

Технические детали

Процесс создания

  1. 1.Дообучение (train.py):
  2. 2.Базовая модель: yandex/YandexGPT-5-Lite-8B-instruct
  3. 3.4-bit quantization (bitsandbytes)
  4. 4.LoRA адаптеры на слоях внимания (qproj, kproj, vproj, oproj)
  5. 5.Датасет: вопросы/ответы психологического характера
  1. 1.Слияние (mergeandsave.py):
  2. 2.LoRA адаптеры объединены с базовой моделью
  3. 3.Результат сохранен в стандартном формате
  1. 1.Конвертация в GGUF (converttogguf.py):
  2. 2.Преобразование в формат GGUF
  3. 3.4-bit квантизация (Q4KM)
  4. 4.Оптимизация для inference

Параметры квантизации

  • —Метод: Q4KM (средний компромисс между качеством и скоростью)
  • —Количество бит: 4 бита на параметр
  • —Экономия памяти: ~75% от оригинального размера
  • —Потеря качества: минимальная (~1-2%)

Производительность

На MacBook Pro M1/M2 (16GB RAM):

  • —Токен в секунду: ~5-10 tok/s (в зависимости от длины контекста)
  • —Первый токен: ~0.5-1.0 сек
  • —Контекст: до 2048 токенов

На NVIDIA GPU (RTX 4090):

  • —Токен в секунду: ~100+ tok/s
  • —Первый токен: ~50-100 мс

Лицензия

Следует лицензии исходной модели yandex/YandexGPT-5-Lite-8B-instruct.

Рекомендации

  • —Требуется минимум 8 GB RAM для llama.cpp с GPU ускорением
  • —Используйте GPU для лучшей производительности
  • —Входной контекст: до 2048 токенов
  • —Рекомендуемые параметры: temperature=0.7, top_p=0.9

Дополнительные ссылки

  • —LoRA адаптер: https://huggingface.co/dariprim/yandexgpt-5-lite-finetuned
  • —llama.cpp: https://github.com/ggerganov/llama.cpp
  • —Ollama: https://ollama.ai
  • —llama-cpp-python: https://github.com/abetlen/llama-cpp-python