datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
hotpotqa-fr-abstracts
HotpotQA-fr (abstracts)
65 565 questions multi-sauts en français, au format de
HotpotQA (Yang et al., 2018). Les questions sont
construites directement sur Wikipédia français, sans traduction. L'annotation
humaine du jeu original est remplacée par une génération par modèle de langue
suivie d'une validation automatique par ablations.
Chaque contexte contient dix paragraphes : les deux abstracts nécessaires à la
réponse et huit distracteurs. Tous les paragraphes sont des abstracts… See the full description on the dataset page: https://huggingface.co/datasets/Mvanypersele/hotpotqa-fr-abstracts.abstractive-qa-llm-eval
Abstractive QA for LLM evaluation
A Hebrew-language dataset of 132 question-answer records, built for testing
whether a language model's generated answer is grounded in its source
document rather than hallucinated. Each record has a question, a
source_text, and a reference_answer whose individual claims are each
backed by exact quoted spans from source_text. Use it to check your own
model the same way: generate an answer, break it into claims, and see
whether each claim traces… See the full description on the dataset page: https://huggingface.co/datasets/HebArabNlpProject/abstractive-qa-llm-eval.
