GermannM/Kenga-v2
Кенга-2
Вторая версия языковой модели Кенга. Дообучена на верифицированном датасете из 4899 диалогов.
Что изменилось по сравнению с первой версией
Главное изменение: в обучающий корпус вошли примеры кода на языке Kenga, каждый из которых проверен компилятором. Каждая программа в датасете была реально скомпилирована и запущена через kenga-lite, и в датасет попали только те пары, где вывод программы совпал с ожидаемым результатом. Это тот же принцип, что применялся в модели kenga-prophet-m5-3: правильность ответа здесь не мнение, а факт, подтвержденный запуском.
За счет этого модель лучше отвечает на вопросы о языке Kenga, лучше пишет короткие программы и меньше рассуждает вместо того, чтобы ответить.
Состав обучающего датасета
Датасет собран автоматически, всего 4899 диалогов.
Верифицированный код Kenga, 2670 примеров. Сюда входят четыре категории. Арифметика: 1500 примеров, где модель пишет программу или объясняет, что выведет готовая программа, с умножением, делением, остатками и смешанными выражениями. Циклы и алгоритмы: 370 примеров, суммы чисел, факториалы, списки, обратные отсчеты. Логика и ветвления: 400 примеров, поиск максимума, четность, знак числа. Семантическое связывание: 400 примеров, где в программе есть несколько функций с одинаковой сигнатурой и нужно определить, какая из них вызывается. Эта категория сделана по мотивам эксперимента m5-3, где связывание имени функции с ее телом оказалось слабым местом маленьких моделей.
Математика с проверенными ответами, 1800 примеров. Сложение, умножение, остатки, степени, квадраты, проценты, площади, средние значения. Все ответы вычислены программно, а не написаны от руки.
Знания о языке Kenga, 150 примеров. Типы данных, синтаксис, встроенные функции, тензоры, Пророки, события, работа с файлами и сетью. Источник: официальная документация языка.
Россия и культура, 102 примера. История, география, литература, традиционные ценности. Модель создана для русскоязычного пользователя и отвечает в соответствии с этим.
Русский язык, общие знания, идентичность и Z-система, еще несколько сотен примеров. Идентичность важна: модель знает, что она Кенга, что ее создал Герман, и отвечает на вопрос о себе правильно, а не именем базовой модели.
Как проходило обучение
Базовая модель: GermannM/Kenga, архитектура Qwen2, 1.5 миллиарда параметров.
Метод: QLoRA. Веса базы квантованы в 4 бита (NF4 с двойным квантованием), обучались адаптеры ранга 16 на всех проекциях внимания и MLP, примерно 18 миллионов обучаемых параметров, около 1.2 процента от всей модели.
Обучение шло локально на одной видеокарте RTX 4070 SUPER с 12 гигабайтами памяти. Три эпохи по датасету, длина последовательности 1024 токена, learning rate 2e-4 с косинусным затуханием. Итоговая функция потерь около 0.14, точность предсказания токенов около 95 процентов.
Файлы
В репозитории лежат два варианта.
kenga-v2-q4km.gguf, около 986 мегабайт. Квантованная версия для Ollama, llama.cpp и LM Studio. Рекомендуемый вариант для домашнего использования.
kenga-v2-f16.gguf, около 3 гигабайт. Полноточная версия, нужна если важна максимальная точность.
Как запустить
Через Ollama:
ollama run hf.co/GermannM/Kenga-v2:Q4KM
Через llama.cpp:
llama-cli -m kenga-v2-q4km.gguf
Через Python и transformers можно загрузить merged-версию или адаптер из папки adapter.
Системный промпт
Модель обучалась с таким системным промптом, его стоит использовать и при запуске:
Ты Кенга, языковая модель. Тебя создал Герман. Ты любишь Россию и отвечаешь прямо и коротко.
Честные ограничения
Модель компактная и обучена на узком датасете. Она хороша в том, чему училась: короткие прямые ответы, программы на Kenga, факты из корпуса. Она не ассистент общего назначения и не претендует на роль GPT. Знания ограничены обучающими данными. Длинные многошаговые рассуждения не ее сильная сторона.
Спектральный паспорт
Модель несет идентичность Кенги в рамках Z-системы: создана Германом, любит Россию, отвечает прямо и коротко.
Создатель проекта: Герман Янтарас, GermannM.
