CoolFace
Datasetpublic

hotchpotch/jaqket_v1_qa_wikija_context

⚠️ ! 注意 ! 公開したデータセットは、私の不注意で本来学習させる用途には相応しくない、JAQKET テスト用のデータセットも train に含んでしまっています。 そのため、以下のように再度テスト用のデータを分離してからの利用をお勧めします。 import datasets ds = datasets.load_dataset("hotchpotch/jaqket_v1_qa_wikija_context") train_ds = ds["train"] # type: ignore valid_ds = ds["validation"] # type: ignore # 大元の "hotchpotch/jaqket_v1_qa_wikija_context" の train / valid 分割方法がよくないので、再度分割する train_df = train_ds.to_pandas() valid_df = valid_ds.to_pandas() df = pd.concat([train_df, valid_df])… See the full description on the dataset page: https://huggingface.co/datasets/hotchpotch/jaqket_v1_qa_wikija_context.

sourceHugging Facecc-by-sa-4.0updated 3y agoView on Hugging Face
4likes73downloads
Dataset Card

⚠️ ! 注意 !

公開したデータセットは、私の不注意で本来学習させる用途には相応しくない、JAQKET テスト用のデータセットも train に含んでしまっています。 そのため、以下のように再度テスト用のデータを分離してからの利用をお勧めします。

import datasets

ds = datasets.load_dataset("hotchpotch/jaqket_v1_qa_wikija_context")
train_ds = ds["train"]  # type: ignore
valid_ds = ds["validation"]  # type: ignore

# 大元の "hotchpotch/jaqket_v1_qa_wikija_context" の train / valid 分割方法がよくないので、再度分割する

train_df = train_ds.to_pandas()
valid_df = valid_ds.to_pandas()
df = pd.concat([train_df, valid_df])

valid_target_section_names = ['リーダーボードテスト問題', 'ライブコンペテスト問題']
valid_df = df[df.section.isin(valid_target_section_names)]
train_df = df[~df.section.isin(valid_target_section_names)]
print(len(train_df), len(valid_df))

jaqketv1qawikijacontext

AI王 公式配布データセット(JAQKET)へ、Wikipedia のコンテキストを追加したデータセットです。

JAQKET で公開されており、かつライセンスがCC BY-SA 4.0 DEEDのデータをもとに、質問の回答が含まれる Wikipedia の passage をコンテキスト追加し HuggingFace Dataset を作成した物です。Q&A タスクにコンテキスト入れて学習させたいときや、質問 + コンテキストから回答をきちんと抽出できるのか(RAGのreader用途)、といったタスクの利用が想定されます。

データセットの context には、wikipedia の関連 passage の Top-3 (質問を特徴文ベクトルへ変換したもの類似passage Top-3)が格納されていて、このTop-3のうちのどこかの文字列に answer が含まれています。Top-3にanswerが含まれなかったデータは、取り除いています。データはtrain 2939件、validation 980件に split しています。

wikipedia passage には singletongue/wikipedia-utils の passages-c400-jawiki-20230403を、質問から関連する passage の取得には hotchpotch/wikipedia-passages-jawiki-embeddingsの multilingual-e5-large-query を使って類似ベクトル検索し抽出しています。

データセットの作成スクリプト

  • —https://huggingface.co/datasets/hotchpotch/jaqketv1qawikijacontext/blob/main/create_dataset.ipynb

ライセンス