CoolFace
Datasetpublic

morizon/TCGA_Reports_ja_structured_qwen38_27b

TCGA Reports Japanese Structured Dataset with Qwen3.8-27B The Cancer Genome Atlas(TCGA)由来の英語病理報告書を日本語へ翻訳し、その日本語病理報告書から主要な病理情報を9項目へ構造化したデータセットです。 既存の morizon/TCGA_Reports_ja_structured と同じ100症例を使用し、生成モデルを Qwen/Qwen3.8-27B に変更して再生成しています。 日本語訳には morizon/TCGA_Reports_ja_qwen38_27b と同じ生成結果を使用しています。 元データ 本データセットでは、The Cancer Genome Atlas(TCGA)の病理報告書をもとに作成されたTCGA-Reportsを使用しています。 TCGAは、複数のがん種についてゲノム情報や臨床情報などを収集した大規模ながん研究プロジェクトです。… See the full description on the dataset page: https://huggingface.co/datasets/morizon/TCGA_Reports_ja_structured_qwen38_27b.

sourceHugging Facecc-by-4.0updated 1mo agoView on Hugging Face
0likes30downloads
Dataset Card

TCGA Reports Japanese Structured Dataset with Qwen3.8-27B

The Cancer Genome Atlas(TCGA)由来の英語病理報告書を日本語へ翻訳し、その日本語病理報告書から主要な病理情報を9項目へ構造化したデータセットです。

既存の morizon/TCGA_Reports_ja_structured と同じ100症例を使用し、生成モデルを Qwen/Qwen3.8-27B に変更して再生成しています。

日本語訳には morizon/TCGA_Reports_ja_qwen38_27b と同じ生成結果を使用しています。

元データ

本データセットでは、The Cancer Genome Atlas(TCGA)の病理報告書をもとに作成されたTCGA-Reportsを使用しています。

TCGAは、複数のがん種についてゲノム情報や臨床情報などを収集した大規模ながん研究プロジェクトです。

TCGA-Reportsは、TCGAの病理報告書PDFをOCRによってテキスト化し、TCGA由来のartifactやformなどを除去して、機械可読なテキストとして整理したデータセットです。

元データには以下を使用しています。

TCGA-Reports: A Machine-Readable Pathology Report Resource for Benchmarking Text-Based AI Models Mendeley Data, Version 1 DOI: 10.17632/hyg5xkznpx.1 https://data.mendeley.com/datasets/hyg5xkznpx/1

TCGA-Reportsには9,523件の英語病理報告書が収録されています。

本データセットでは、そのうち既存の morizon/TCGA_Reports_ja_structured と同じ100症例を使用しています。

データ構成

100症例を収録しています。

カラム内容
idx元データに対応する症例番号
question_enTCGA-Reportsの英語病理報告書テキスト
question_jaQwen3.8-27Bによって生成した日本語訳
answer_ja日本語病理報告書から抽出した構造化JSON

answer_ja は以下の9項目で構成されます。

json
{
  "臓器": "",
  "採取方法": "",
  "診断": "",
  "分化度": "",
  "病期": "",
  "腫瘍径": "",
  "浸潤範囲": "",
  "断端": "",
  "その他所見": ""
}

病理報告書に明記されていない項目は空文字としています。

生成方法

英語病理報告書から日本語訳を生成し、その日本語訳から9項目の構造化情報を抽出しました。

翻訳 / 構造化ともに以下のモデルを使用しています。

Qwen/Qwen3.8-27B

推論条件は以下です。

  • 推論基盤: SGLang
  • dtype: bfloat16
  • Thinking: disabled
  • temperature: 0.1
  • top_p: 1.0
  • top_k: -1
  • max_tokens: 20000

既存の morizon/TCGA_Reports_ja_structured で使用した翻訳 / 構造化プロンプトは変更せず、生成モデルをQwen3.8-27Bへ変更しています。

構造化プロンプト

System prompt

text
あなたは病理報告書の情報抽出アシスタントです。出力は日本語のSTRICT JSONのみで、説明やコメントは一切禁止です。

User prompt

text
次の日本語テキストから下記の項目を抽出し、日本語のSTRICT JSONのみを返してください。明記されていない項目は空文字にしてください。
項目(キーは日本語):
{schema}

テキスト:
<<<{text}>>>

利用目的と注意事項

本データセットは、病理報告書の日本語翻訳、情報抽出、構造化、LLMの学習や評価など、研究 / 教育での利用を主な目的として作成しています。

question_jaanswer_ja はLLMによって日本語訳および構造化をしており、医療専門家による確認を行ったものではありません。

本データセットを実際の診断、治療方針の決定、その他の臨床上の意思決定へ直接使用することは想定していません。

ライセンスと帰属

本データセットは、以下の公開データをもとに作成しています。

TCGA-Reports: A Machine-Readable Pathology Report Resource for Benchmarking Text-Based AI Models Mendeley Data, Version 1 DOI: 10.17632/hyg5xkznpx.1 https://data.mendeley.com/datasets/hyg5xkznpx/1

TCGA-Reportsは Creative Commons Attribution 4.0 International(CC BY 4.0)で公開されています。

https://creativecommons.org/licenses/by/4.0/

本データセットでは、TCGA-Reportsの英語病理報告書にLLMによる日本語翻訳と9項目の構造化を追加しており、同じく CC BY 4.0 で提供します。

再利用や再配布を行う場合は、CC BY 4.0の条件に従い、TCGA-Reportsと本データセットの出典を明記してください。

関連データセット

  • morizon/TCGA_Reports_question_en
  • morizon/TCGA_Reports_ja_qwen38_27b
  • morizon/TCGA_Reports_ja_structured