datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
openorca-multiplechoice-10kA 10k subset of OpenOrca dataset, focusing on multiple choice questions.
Credit to Tian Xia.
labeled-multiple-choice-explainedThis dataset is based on under-tree/labeled-multiple-choice but using GPT-3.5-turbo to generate explanations for each answer option.
This was a very basic attempt to follow the Orca paper approach of a 'teacher' model to provide more context to some trivia questions.
Questions were deduplicated based on the question text.
I used the python library guidance to help generate the prompts. Below is the prompt template I used.
{{#role 'system'~}}
You are an AI assistant that helps people find… See the full description on the dataset page: https://huggingface.co/datasets/layoric/labeled-multiple-choice-explained.wikipedia_multiple_choice_qa
Galician and Portuguese Multiple-Choice QA Instruction Subsets
Dataset description
This dataset contains two instruction-tuning subsets for multiple-choice question answering in Galician and Portuguese:
gl_wikipedia_multiple_choice_qa (1,486 instances)
pt_wikipedia_multiple_choice_qa (547 instances)
Both subsets are reformatted versions of QA data originally included in the cpt_instruction_datasets collection, adapted here as standalone instruction-style datasets.
Each… See the full description on the dataset page: https://huggingface.co/datasets/proxectonos/wikipedia_multiple_choice_qa.Vietnamese-Openorca-Multiplechoice-gg-translatedmultiple-choice-questions
Questões de Múltipla Escolha - Base de dados (PT-BR)
Contextualização
Este repositório contém uma base de dados (data.json) com questões de múltipla escolha, a qual foi utilizada principalmente no desenvolvimento de modelos de recuperação de informação.
Descrição do conjunto de dados
O conjunto de dados é composto por questões de múltipla escolha, abrangendo uma variedade de temas dentro da área da Ciência da Computação. Cada questão é estruturada em formato… See the full description on the dataset page: https://huggingface.co/datasets/mateus-hamade/multiple-choice-questions.openorca-multiplechoice-5k-comparisonsA subset of beaugogh/openorca-multiplechoice-10k, where model responses are added as the "rejected" responses.
The model used here is beaugogh/Llama2-7b-openorca-mc-v2.
multiple-choiceSAE_Circuit_Multiple_Choice_QA
Sparse-Feature-Circuits-Multiple-Choice-Dataset
Including three types of multiple choice questions
Number Comparison
Which is larger, {num1} or {num2}?\n(A): {num1}\n(B): {num2}\nAnswer: (
String Matching
Which of the following options corresponds to \"{target_string}\"?\n(A) \"{options[0]}\"\n(B) \"{options[1]}\"\nAnswer: (
Subject-verb Agreement
{data['clean_prefix']} [MASK]:\n(A) {options_content[0]}\n(B) {options_content[1]}\nAnswer: (
scrambled_words_multiple_choiceparsinlu-multiple-choice-alpaca-style
ParsiNLU Multiple Choice in Alpaca Style
This dataset is an Alpaca-style and instruction-included version of the ParsiNLU original dataset.
Multiple_choices-30k
Dataset Description
Combined datasets for training LLMs on Qwestion_Answering and Multiple_Choices.
These datasets are all for general knowledge, commonsense reasoning, and reading comprehension abilities of AI models.
Source Data
allenai/ai2_arc -----------------"https://huggingface.co/datasets/allenai/ai2_arc"
allenai/openbookqa ----------"https://huggingface.co/datasets/allenai/openbookqa"
tau/commonsense_qa… See the full description on the dataset page: https://huggingface.co/datasets/HashTag766/Multiple_choices-30k.legal-multiple-choicefinewebedu-multiple-choicemultiplechoice_med
