datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
llm-jp-longbench-JEMHop
llm-jp-longbench-JEMHopQA
llm-jp LongBench ベンチマークについて
このデータセットは,GitHub リポジトリhttps://github.com/llm-jp/llm-jp-longbenchで公開されているllm-jp LongBenchベンチマークの評価対象データセットの一部として構築されています。
llm-jp LongBench ベンチマークは,日本語大型言語モデル(LLM)のロングコンテキスト処理能力を体系的に評価することを目的としており,複数の長文コンテキスト QA データセットを含んでいます。
本データセットはその一つです。
データセット概要
本データセットは、日本語の説明可能マルチホップ質問応答データセットJEMHopQA
(Ishii et al., 2024)を基に、Wikipedia記事を付与することで構築したロングコンテキストQA評価用データセットです。
最大65… See the full description on the dataset page: https://huggingface.co/datasets/llm-jp/llm-jp-longbench-JEMHop.llm-jp-longbench-NIILC
llm-jp-longbench-NIILC
llm-jp LongBench ベンチマークについて
このデータセットは,GitHub リポジトリhttps://github.com/llm-jp/llm-jp-longbenchで公開されているllm-jp LongBenchベンチマークの評価対象データセットの一部として構築されています。
llm-jp LongBench ベンチマークは,日本語大型言語モデル(LLM)のロングコンテキスト処理能力を体系的に評価することを目的としており,複数の長文コンテキスト QA データセットを含んでいます。
本データセットはその一つです。
データセット概要
本データセットは,日本語質問応答データセット NIILC
(Sekine, 2003)を基に,
回答が一意に定まり,かつ時間によって正解が変化しない質問のみを選別し,
それらに対応する Wikipedia 記事をコンテキストとして付与することで構築した,
ロングコンテキスト QA 評価用データセットです。… See the full description on the dataset page: https://huggingface.co/datasets/llm-jp/llm-jp-longbench-NIILC.
