Mori-kamiyama/line-reply-gate-delta
010
line-reply-gate-delta
Delta は sbintuitions/sarashina2.2-0.5b-instruct-v0.1 をベースに fine-tuning した、LINE 会話向けの返信ゲート分類モデルです。
このモデルは、直近の会話状態に対して次の 3 ラベルを予測します。
ignorebackchannelreply
タスク概要
この分類器は、返信文生成の前段で「そもそも返すべきか」を判定する用途を想定しています。
ignore: ボットは返答しないbackchannel: 短い相づちやリアクションで十分reply: 内容のある返答を生成する
このリポジトリには fine-tuning 後の重みを含みます。学習パイプライン全体やベンチマーク用データセット本体は含みません。
学習概要
- モデル名:
Delta - ベースモデル:
sbintuitions/sarashina2.2-0.5b-instruct-v0.1 - 学習データ件数:
5003 - 評価データ件数:
554 - 学習方式: full fine-tuning
学習データの由来
学習データには、人手で整備したデータに加えて、合成データ生成フローで作成したサンプルを含みます。
リポジトリ内で確認できた合成データ生成モデルは以下です。
openai/gpt-oss-120bhf.co/unsloth/Qwen3-32B-GGUF:Q4_K_M
確認できた範囲では、上記 2 モデル系が合成データ生成に関与しています。
検証指標
以下は alpha_metadata.json に保存されている trainer の evaluation split 上の指標です。
- Eval accuracy:
0.47653429602888087 - Eval macro F1:
0.44592308186778234 - Eval F1 (
ignore):0.5012406947890818 - Eval F1 (
backchannel):0.2424242424242424 - Eval F1 (
reply):0.5941043083900227
ローカルベンチマーク
プロジェクト内で使っている 60 件の均等ベンチマークでは、Delta は次の結果でした。
- Accuracy:
0.70(42 / 60) - Macro F1:
0.6812 - F1 (
ignore):0.6222 - F1 (
backchannel):0.5517 - F1 (
reply):0.8696
このベンチマークは小規模でタスク特化です。広い意味での汎用性能評価ではなく、回帰確認のための指標として使うのが適切です。
使い方
from transformers import AutoTokenizer, AutoModelForSequenceClassification
model_id = "Mori-kamiyama/line-reply-gate-delta"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSequenceClassification.from_pretrained(model_id)想定用途
- 日本語の LINE 風会話における返信要否判定
ignore/backchannel/replyのオフライン評価- より大きな応答生成モデルの前段に置く軽量な判定器
制約
- ここに記載しているベンチマークは件数が少なく、クラス数も固定です。
backchannelが最も弱いクラスであり、主な改善対象です。- 汎用の安全性判定やモデレーション用途には向いていません。
リポジトリ内容
model.safetensors: fine-tuning 後の重みconfig.json: モデル設定tokenizer.json/tokenizer_config.json: tokenizer 関連ファイルchat_template.jinja: 学習成果物に含まれる chat templatealpha_metadata.json: ローカル成果物名を維持した学習メタデータ
