CoolFace
Datasetpublic

akiFQC/japanese-confidential-information-extraction-sft

Japanese Confidential Information Extraction — SFT Dataset 日本語テキストから社外秘の固有表現を抽出するタスク向けの SFT (Supervised Fine-Tuning) データセットです。 LFM2 系モデルの LoRA fine-tune を想定して構築されています。 タスク概要 入力テキスト(日本語)に含まれる機密情報を、11カテゴリの JSON として抽出します。 入力: 「山田太郎(yamada@example.co.jp)から請求書番号 INV-2024-0042 で 売上 ¥12,800,000 の見積書が届いた。」 出力: { "address": [], "company_name": [], "email_address": ["yamada@example.co.jp"], "human_name": ["山田太郎"], "phone_number": [], "account_identifier":… See the full description on the dataset page: https://huggingface.co/datasets/akiFQC/japanese-confidential-information-extraction-sft.

sourceHugging Faceotherupdated 4mo agoView on Hugging Face
2likes22downloads
Dataset Card

Japanese Confidential Information Extraction — SFT Dataset

日本語テキストから社外秘の固有表現を抽出するタスク向けの SFT (Supervised Fine-Tuning) データセットです。 LFM2 系モデルの LoRA fine-tune を想定して構築されています。

タスク概要

入力テキスト(日本語)に含まれる機密情報を、11カテゴリの JSON として抽出します。

入力: 「山田太郎(yamada@example.co.jp)から請求書番号 INV-2024-0042 で
      売上 ¥12,800,000 の見積書が届いた。」

出力: {
  "address": [],
  "company_name": [],
  "email_address": ["yamada@example.co.jp"],
  "human_name": ["山田太郎"],
  "phone_number": [],
  "account_identifier": [],
  "network_identifier": [],
  "system_config": [],
  "project_info": [],
  "financial_info": ["¥12,800,000"],
  "transaction_id": ["INV-2024-0042"]
}

カテゴリ定義

カテゴリ内容
address住所・所在地
company_name企業・研究機関・組織名
email_addressメールアドレス
human_name人名
phone_number電話番号
account_identifierアカウント識別子(ユーザーID・アカウント名・従業員番号・マイナンバー等)
network_identifierネットワーク識別情報(IPアドレス・MACアドレス・内部ドメイン・ホスト名)
system_configシステム構成情報(ファイルパス・ディレクトリ構造・DBテーブル/カラム名)
project_infoプロジェクト関連情報(プロジェクト名・開発コードネーム・未発表の製品/機能名)
financial_info金額・財務情報(売上・原価・利益率・契約金額・個人の給与/報酬額)
transaction_id取引管理番号(契約書番号・請求書番号・見積書番号・顧客管理ID)

データセット統計

Split行数
train38,852
validation2,045
total40,897

データ形式

messages 列に [system, user, assistant] の3ターン会話が格納されています。

python
{
  "messages": [
    {
      "role": "system",
      "content": "あなたはテキストから社外秘の固有表現を抽出するアシスタントです。..."
    },
    {
      "role": "user",
      "content": "<入力テキスト>"
    },
    {
      "role": "assistant",
      "content": "{\"address\": [], \"company_name\": [], ...}"
    }
  ]
}

assistant の出力は 全11キーを必ず含む JSON 文字列です。該当エンティティがない場合は空リストになります。

ソースデータセット

ソース言語備考
OpenPII 1.5Mja(フィルタ後 約20,754行)日本語行のみ抽出
ner-wikipedia-datasetjaWikipedia由来の固有表現
syntheticja未カバーカテゴリ(network_identifier, system_config, financial_info, transaction_id)の補強用 LLM 合成データ(`google/gemma-4-26B-A4B-it`を使用)

使い方

HuggingFace Datasets でロード(Hub 公開後)

python
from datasets import load_dataset

ds = load_dataset("your-org/japanese-confidential-information-extraction-sft")
print(ds["train"][0]["messages"])

ライセンス

各ソースデータセットのライセンスに従います。合成データは生成モデルの利用規約に準拠しています。