CoolFace
Modelpublic

yoikoarmor/yoiko-img-prompt-gen-qwen2.5-7b-instruct-Q4_K_M

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes34downloads
Model Card

yoiko-Qwen2.5-7B-Instruct-GGUF

Qwen/Qwen2.5-7B-Instruct をベースに、画像生成向けプロンプト生成用LoRAをマージし、llama.cpp向けにGGUF Q4KM量子化したモデルです。

このモデルは汎用チャット用途ではなく、短い日本語または英語の入力を Stable Diffusion などで使いやすい positive prompt へ整える用途を想定しています。今回のGPUベンチでは、Q4KM版3モデルの中で最速でした。

ファイル

filequantizationsizesha256
yoiko-img-prompt-gen-qwen2.5-7b-instruct-Q4_K_M.ggufQ4KM4.361 GBb5b75a12c84773817b81b2ed117ce70bcff99f8d1b020f281b8723e594cecd7f

元モデル

  • —Base model: Qwen/Qwen2.5-7B-Instruct
  • —LoRA: yoikoarmor/yoiko-Qwen2.5-7B-Instruct-lora
  • —Format: GGUF
  • —Quantization: Q4KM
  • —Converter/runtime: llama.cpp b9605

使い方

bash
llama-cli -m yoiko-img-prompt-gen-qwen2.5-7b-instruct-Q4_K_M.gguf ^
  -p "女性、高身長、ビジネススーツ、刀、赤と青の目とバラ、強者" ^
  -n 128 -c 1024 -ngl 999 --temp 0.7

-ngl 999 はGPUへ可能な限りoffloadする設定です。CPUだけで使う場合は -ngl 0 にしてください。

ベンチマーク

llama.cpp b9605, RTX 5090, -ngl 999, p16/tg8:

backendprompt evaltoken generation
CPU112.21 t/s12.16 t/s
CUDA1947.38 t/s207.85 t/s

注意

  • —出力は画像生成用prompt候補です。最終的な安全性や品質は使用者側で確認してください。
  • —Q4KMはF16と完全同一の出力にはなりませんが、サイズと速度のバランスが良い量子化です。

English

This is a GGUF Q4KM quantization of a LoRA-merged Qwen/Qwen2.5-7B-Instruct model for image prompt generation. It is intended to rewrite short Japanese or English inputs into Stable Diffusion-style positive prompts.