softjapan/qwen2-jaquad-gguf
014
Qwen2 JAQUAD SFT – GGUF Weights (Merged)
このリポジトリは GGUF 形式のモデル重みを提供します。 ベース `Qwen/Qwen2-1.5B-Instruct` に対し、日本語の 指示追従/QA/要約 を目的として SFT(LoRA)を実施し、merge_and_unload() でマージ済み単体モデルに統合した後、GGUF へ変換しています。llama.cpp や llama-cpp-python でそのまま利用できます。
想定用途: 日本語の要約、抽出型QA、フォーマット遵守(JSON/箇条書き)、敬体・常体のスタイル制御 非推奨: 医療/法務/最新ニュース等の高リスク用途での断定的回答
提供ファイル
qwen2-jaquad-jaquadSFT-f16.gguf… 変換元(FP16)qwen2-jaquad-jaquadSFT-Q4_K_M.gguf… 量子化(Q4_K_M:軽量と品質のバランスが良い定番)
必要に応じて Q5_K_M など他の量子化バリアントも追加可能です(Issue へどうぞ)。チェックサム(任意で記載)
ダウンロード後に整合性確認できます。
sha256sum qwen2-jaquad-jaquadSFT-f16.gguf
sha256sum qwen2-jaquad-jaquadSFT-Q4_K_M.gguf使い方(llama.cpp / CLI)
CPU例
llama-cli \
-m qwen2-jaquad-jaquadSFT-Q4_K_M.gguf \
-t $(nproc) \
-c 4096 \
-p "### 指示\n次の文章を要約してください。\n\n### 入力\n日本の首都は東京で...\n\n### 応答\n" \
-n 256 --temp 0.7 --top-p 0.95CUDA例(ビルド時に -DGGML_CUDA=ON)
llama-cli \
-m qwen2-jaquad-jaquadSFT-Q4_K_M.gguf \
-ngl 999 \
-c 4096 \
-p "### 指示\n次の文章を要約してください。\n\n### 入力\n日本の首都は東京で...\n\n### 応答\n" \
-n 256 --temp 0.7 --top-p 0.95重要:学習時のフォーマットに合わせ、プロンプトは ### 指示 / ### 入力 / ### 応答 の3セクションで与えると従順性が安定します。使い方(Python / llama-cpp-python)
from llama_cpp import Llama
llm = Llama(
model_path="qwen2-jaquad-jaquadSFT-Q4_K_M.gguf", # or f16.gguf
n_ctx=4096,
n_gpu_layers=-1, # GPU利用(CUDAビルド時)
)
prompt = """### 指示
次の文章を40字以内で要約してください。固有名詞は保持。
### 入力
日本の首都は東京で、経済・文化・政治の中心として発展してきた。
### 応答
"""
out = llm(
prompt,
max_tokens=256,
temperature=0.7,
top_p=0.95,
)
print(out["choices"][0]["text"])推奨プロンプト例
抽出型QA(最短回答のみ)
### 指示
次の文章から質問に対する最短の答えのみを返してください。
### 入力
段落:「江戸幕府を開いたのは徳川家康である。1603年、家康は征夷大将軍に任ぜられた。」
質問:「江戸幕府を開いたのは誰?」
### 応答構造化(JSON)
### 指示
以下テキストから日時・場所・イベント名を抽出し、JSONで返してください。
キーは "date","place","title"。
### 入力
2025年10月12日、渋谷の○○ホールでAIカンファレンス「GenAI EXPO 2025」が開催されます。
### 応答変換メモ
- 変換:
convert_hf_to_gguf.py <merged_model_dir> --outtype f16 - 量子化:
llama-quantize <f16.gguf> <out.gguf> Q4_K_M
llama.cppは CMake ビルド。CUDA を使う場合は-DGGML_CUDA=ONを付けてビルドしてください。
制約・リスク / Limitations & Risks
- 事実性:最新情報や専門領域では誤答の可能性があります。
- 安全性:不適切・攻撃的・偏見を含む出力の可能性があります。
- 分布外入力:学習分布から外れた入力では品質が低下します。
推奨事項
- 高リスク用途では 人手レビュー、RAG(検索拡張)、プロンプト制約 を併用してください。
- 運用時は ログ監査 と レート制御 を導入してください。
ライセンス / License
- 本GGUFは マージ済みフル重みを含みます。 ベースモデル(
Qwen/Qwen2-1.5B-Instruct)および学習データのライセンス/利用規約に従ってください。 - 本リポジトリのライセンス表記は
apache-2.0です。
引用 / Citation
@software{qwen2_jaquad_sft_gguf_2025,
title = {Qwen2 JAQUAD SFT – GGUF Weights (Merged)},
author = {softjapan},
year = {2025},
url = {https://huggingface.co/softjapan/qwen2-jaquad-gguf}
}連絡先 / Contact
- Maintainer: softjapan
- Issues / PR: 本リポジトリの「Issues」「Pull Requests」をご利用ください
