CoolFace
Datasetpublic

YANS-official/ogiri-debug

読み込み方 from datasets import load_dataset dataset = load_dataset("YANS-official/ogiri-debug", split="test") 概要 大喜利生成の動作確認用データセットです。以下の3タスクが含まれます。 text_to_text: テキストでお題が渡され、それに対する回答を返します。 image_to_text: いわゆる「画像で一言」です。画像のみが渡されて、テキストによる回答を返します。 text_image_to_text: 画像中にテキストが書かれています。テキストの一部が空欄になっているので、そこに穴埋めする形で回答を返します。 データセットの各カラム説明 カラム名 型 例 概要 odai_id str "origi-dummy-1" お題のID file_path str "dummy.png" 画像のファイル名 type str… See the full description on the dataset page: https://huggingface.co/datasets/YANS-official/ogiri-debug.

sourceHugging Faceupdated 2y agoView on Hugging Face
2likes23downloads
Dataset Card

読み込み方

python
from datasets import load_dataset

dataset = load_dataset("YANS-official/ogiri-debug", split="test")

概要

大喜利生成の動作確認用データセットです。 以下の3タスクが含まれます。

  • —texttotext: テキストでお題が渡され、それに対する回答を返します。
  • —imagetotext: いわゆる「画像で一言」です。画像のみが渡されて、テキストによる回答を返します。
  • —textimageto_text: 画像中にテキストが書かれています。テキストの一部が空欄になっているので、そこに穴埋めする形で回答を返します。

データセットの各カラム説明

カラム名型例概要
odai_idstr"origi-dummy-1"お題のID
file_pathstr"dummy.png"画像のファイル名
typestr"texttotext""texttotext", "imagetotext", "imagetextto_text"のどれかが入っている。
odaistr"この学会、なんだか疲れるなぁ…どんなの?""texttotext"の場合はお題。"imagetotext"の場合は"画像で一言"という文字列が格納されている。"imagetextto_text"は画像をOCRした結果に"[空欄]"が入ったもの。