CoolFace
Modelpublic

softjapan/qwen2-jaquad-gguf

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes14downloads
Model Card

Qwen2 JAQUAD SFT – GGUF Weights (Merged)

このリポジトリは GGUF 形式のモデル重みを提供します。 ベース `Qwen/Qwen2-1.5B-Instruct` に対し、日本語の 指示追従/QA/要約 を目的として SFT(LoRA)を実施し、merge_and_unload() でマージ済み単体モデルに統合した後、GGUF へ変換しています。llama.cpp や llama-cpp-python でそのまま利用できます。

想定用途: 日本語の要約、抽出型QA、フォーマット遵守(JSON/箇条書き)、敬体・常体のスタイル制御 非推奨: 医療/法務/最新ニュース等の高リスク用途での断定的回答

提供ファイル

  • —qwen2-jaquad-jaquadSFT-f16.gguf … 変換元(FP16)
  • —qwen2-jaquad-jaquadSFT-Q4_K_M.gguf … 量子化(Q4_K_M:軽量と品質のバランスが良い定番)
必要に応じて Q5_K_M など他の量子化バリアントも追加可能です(Issue へどうぞ)。

チェックサム(任意で記載)

ダウンロード後に整合性確認できます。

bash
sha256sum qwen2-jaquad-jaquadSFT-f16.gguf
sha256sum qwen2-jaquad-jaquadSFT-Q4_K_M.gguf

使い方(llama.cpp / CLI)

CPU例

bash
llama-cli \
  -m qwen2-jaquad-jaquadSFT-Q4_K_M.gguf \
  -t $(nproc) \
  -c 4096 \
  -p "### 指示\n次の文章を要約してください。\n\n### 入力\n日本の首都は東京で...\n\n### 応答\n" \
  -n 256 --temp 0.7 --top-p 0.95

CUDA例(ビルド時に -DGGML_CUDA=ON)

bash
llama-cli \
  -m qwen2-jaquad-jaquadSFT-Q4_K_M.gguf \
  -ngl 999 \
  -c 4096 \
  -p "### 指示\n次の文章を要約してください。\n\n### 入力\n日本の首都は東京で...\n\n### 応答\n" \
  -n 256 --temp 0.7 --top-p 0.95
重要:学習時のフォーマットに合わせ、プロンプトは ### 指示 / ### 入力 / ### 応答 の3セクションで与えると従順性が安定します。

使い方(Python / llama-cpp-python)

python
from llama_cpp import Llama

llm = Llama(
    model_path="qwen2-jaquad-jaquadSFT-Q4_K_M.gguf",  # or f16.gguf
    n_ctx=4096,
    n_gpu_layers=-1,   # GPU利用(CUDAビルド時)
)

prompt = """### 指示
次の文章を40字以内で要約してください。固有名詞は保持。

### 入力
日本の首都は東京で、経済・文化・政治の中心として発展してきた。

### 応答
"""

out = llm(
    prompt,
    max_tokens=256,
    temperature=0.7,
    top_p=0.95,
)
print(out["choices"][0]["text"])

推奨プロンプト例

抽出型QA(最短回答のみ)

### 指示
次の文章から質問に対する最短の答えのみを返してください。

### 入力
段落:「江戸幕府を開いたのは徳川家康である。1603年、家康は征夷大将軍に任ぜられた。」
質問:「江戸幕府を開いたのは誰?」

### 応答

構造化(JSON)

### 指示
以下テキストから日時・場所・イベント名を抽出し、JSONで返してください。
キーは "date","place","title"。

### 入力
2025年10月12日、渋谷の○○ホールでAIカンファレンス「GenAI EXPO 2025」が開催されます。

### 応答

変換メモ

  • —変換: convert_hf_to_gguf.py <merged_model_dir> --outtype f16
  • —量子化: llama-quantize <f16.gguf> <out.gguf> Q4_K_M
llama.cpp は CMake ビルド。CUDA を使う場合は -DGGML_CUDA=ON を付けてビルドしてください。

制約・リスク / Limitations & Risks

  • —事実性:最新情報や専門領域では誤答の可能性があります。
  • —安全性:不適切・攻撃的・偏見を含む出力の可能性があります。
  • —分布外入力:学習分布から外れた入力では品質が低下します。

推奨事項

  • —高リスク用途では 人手レビュー、RAG(検索拡張)、プロンプト制約 を併用してください。
  • —運用時は ログ監査 と レート制御 を導入してください。

ライセンス / License

  • —本GGUFは マージ済みフル重みを含みます。 ベースモデル(Qwen/Qwen2-1.5B-Instruct)および学習データのライセンス/利用規約に従ってください。
  • —本リポジトリのライセンス表記は apache-2.0 です。

引用 / Citation

@software{qwen2_jaquad_sft_gguf_2025,
  title  = {Qwen2 JAQUAD SFT – GGUF Weights (Merged)},
  author = {softjapan},
  year   = {2025},
  url    = {https://huggingface.co/softjapan/qwen2-jaquad-gguf}
}

連絡先 / Contact

  • —Maintainer: softjapan
  • —Issues / PR: 本リポジトリの「Issues」「Pull Requests」をご利用ください