datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
llm-jp-corpus-v4-ja_wiki-manufacturing
ja_wiki 製造業コーパス
llm-jp-corpus-v4 の
ja/ja_wiki(120 万記事)から、製造業に関連する文書を抽出した継続事前学習(CPT)用データ。
文書数
47,914 件(元コーパスの 3.99%)
文字数
105M 字(推定 74M トークン)
形式
JSONL・1 行 1 文書
抽出方法
キーワード一致では役に立たない。「製造」「工場」で本文先頭を引くと 5.7% が命中するが、
中身は工場や製造に一言触れただけの記事が大半だった。そこで 精度を Wikipedia の
カテゴリ木、網羅性を分類器に担わせ、その和集合を採っている。
カテゴリ木 — 製造業・業種別・機械工学・材料工学・産業遺産など 42 のシードから
日本語 Wikipedia のカテゴリグラフを深さ 3 まで辿る(SQL ダンプからオフライン構築)。
突合 — 得られたタイトルを ja_wiki の実在記事に絞る。
分類器 — 上記を正例、無作為抽出を負例として、文字… See the full description on the dataset page: https://huggingface.co/datasets/Podtech/llm-jp-corpus-v4-ja_wiki-manufacturing.sft_data_manufacturing_self-instruct
Dataset Card for SFT_data_manufacturing_self-instruct
本データセットは、製造業における現場の課題解決(異常検知、保守履歴分析、予防保全計画の最適化など)を目的として、Self-Instructを用いて生成されたSFT (Supervised Fine-Tuning)データセットです。
製造現場特有の専門的なデータ(センサーログ、保守履歴、停止データ)をAIがどのように解釈し、論理的な推論に基づいて対策立案まで行えるかを検証・学習するために設計されました。
Dataset Details
Dataset Description
本データセットは、製造業における現場の疑問や専門的な指示に対する回答を学習させるために作成された、100件の質問応答データです。
各データはJSONL形式で以下の構造を持っています。
フィールド名
データ型
内容の説明
instruction
String
現場における具体的なタスク指示。… See the full description on the dataset page: https://huggingface.co/datasets/Podtech/sft_data_manufacturing_self-instruct.
