akiFQC/japanese-confidential-information-extraction-sft
Japanese Confidential Information Extraction — SFT Dataset 日本語テキストから社外秘の固有表現を抽出するタスク向けの SFT (Supervised Fine-Tuning) データセットです。 LFM2 系モデルの LoRA fine-tune を想定して構築されています。 タスク概要 入力テキスト(日本語)に含まれる機密情報を、11カテゴリの JSON として抽出します。 入力: 「山田太郎(yamada@example.co.jp)から請求書番号 INV-2024-0042 で 売上 ¥12,800,000 の見積書が届いた。」 出力: { "address": [], "company_name": [], "email_address": ["yamada@example.co.jp"], "human_name": ["山田太郎"], "phone_number": [], "account_identifier":… See the full description on the dataset page: https://huggingface.co/datasets/akiFQC/japanese-confidential-information-extraction-sft.
Japanese Confidential Information Extraction — SFT Dataset
日本語テキストから社外秘の固有表現を抽出するタスク向けの SFT (Supervised Fine-Tuning) データセットです。 LFM2 系モデルの LoRA fine-tune を想定して構築されています。
タスク概要
入力テキスト(日本語)に含まれる機密情報を、11カテゴリの JSON として抽出します。
入力: 「山田太郎(yamada@example.co.jp)から請求書番号 INV-2024-0042 で
売上 ¥12,800,000 の見積書が届いた。」
出力: {
"address": [],
"company_name": [],
"email_address": ["yamada@example.co.jp"],
"human_name": ["山田太郎"],
"phone_number": [],
"account_identifier": [],
"network_identifier": [],
"system_config": [],
"project_info": [],
"financial_info": ["¥12,800,000"],
"transaction_id": ["INV-2024-0042"]
}カテゴリ定義
データセット統計
データ形式
messages 列に [system, user, assistant] の3ターン会話が格納されています。
{
"messages": [
{
"role": "system",
"content": "あなたはテキストから社外秘の固有表現を抽出するアシスタントです。..."
},
{
"role": "user",
"content": "<入力テキスト>"
},
{
"role": "assistant",
"content": "{\"address\": [], \"company_name\": [], ...}"
}
]
}assistant の出力は 全11キーを必ず含む JSON 文字列です。該当エンティティがない場合は空リストになります。
ソースデータセット
使い方
HuggingFace Datasets でロード(Hub 公開後)
from datasets import load_dataset
ds = load_dataset("your-org/japanese-confidential-information-extraction-sft")
print(ds["train"][0]["messages"])ライセンス
各ソースデータセットのライセンスに従います。合成データは生成モデルの利用規約に準拠しています。
