CoolFace
Modelpublic

yoikoarmor/yoiko-img-prompt-gen-qwen3.5-9b-Q4_K_M

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes156downloads
Model Card

yoiko-Qwen3.5-9B-GGUF

Qwen/Qwen3.5-9B をベースに、画像生成向けプロンプト生成用LoRAをマージし、llama.cpp向けにGGUF Q4KM量子化したモデルです。

このモデルは汎用チャット用途ではなく、短い日本語または英語の入力を Stable Diffusion などで使いやすい positive prompt へ整える用途を想定しています。3モデルの中では最も大きく、表現量重視の選択肢です。

ファイル

filequantizationsizesha256
yoiko-img-prompt-gen-qwen3.5-9b-Q4_K_M.ggufQ4KM5.243 GB5a97d7d978f0c3e644e300fe00b14b1dca841ee1bab8f743c92979a41c2d6c3f

元モデル

  • —Base model: Qwen/Qwen3.5-9B
  • —LoRA: yoikoarmor/yoiko-Qwen3.5-9B-lora
  • —Format: GGUF
  • —Quantization: Q4KM
  • —Converter/runtime: llama.cpp b9605
  • —Note: Qwen3.5 GGUF conversion uses no-MTP output because the merged LoRA artifact does not include MTP tensors.

使い方

bash
llama-cli -m yoiko-img-prompt-gen-qwen3.5-9b-Q4_K_M.gguf ^
  -p "女性、高身長、ビジネススーツ、刀、赤と青の目とバラ、強者" ^
  -n 128 -c 1024 -ngl 999 --temp 0.7

-ngl 999 はGPUへ可能な限りoffloadする設定です。CPUだけで使う場合は -ngl 0 にしてください。9Bは短い max_new_tokens だと末尾が切れやすいため、-n 96 以上を推奨します。

ベンチマーク

llama.cpp b9605, RTX 5090, -ngl 999, p16/tg8:

backendprompt evaltoken generation
CPU86.76 t/s10.19 t/s
CUDA1539.87 t/s143.67 t/s

注意

  • —出力は画像生成用prompt候補です。最終的な安全性や品質は使用者側で確認してください。
  • —Q4KMはF16と完全同一の出力にはなりませんが、サイズと速度のバランスが良い量子化です。

English

This is a GGUF Q4KM quantization of a LoRA-merged Qwen/Qwen3.5-9B model for image prompt generation. It is intended to rewrite short Japanese or English inputs into Stable Diffusion-style positive prompts.