umiyuki/JDocQA_SingleImage_200
JDocQA_SingleImage_200 Dataset Dataset Summary JDocQA_SingleImage_200は、shunk031/JDocQAのtestサブセットを基に作成されたデータセットで、PDFファイルを200dpiの画像に変換し、画像が取得できない設問と複数画像が必要な設問を除外しています。さらに計測時間短縮のために各設問形式毎に50問、計200問に絞りました。元のデータセットが37GBと大きすぎるため、サイズを削減しつつ実用性を保つことを目的としています。 元データ: shunk031/JDocQA (test split, 1,176 instances) 変換後: PDFを画像に置き換え、画像が取得できてかつ単一画像入力の設問のみを含む。さらに各設問形式毎に先頭から50問ずつに絞る。 言語: 日本語 (BCP-47 ja-JP) Data Fields input_text: 質問テキスト question_id: ユニークなID… See the full description on the dataset page: https://huggingface.co/datasets/umiyuki/JDocQA_SingleImage_200.
Conversations for this repository live on Hugging Face.
CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.
Open discussions on Hugging Face