datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
prompt-quality-vs-response-compliance
Prompt Quality vs Response Compliance — per-item results
Per-item numeric results from a study that measures prompt quality and response
compliance as separate constructs, rather than treating a model's response
score as a proxy for the person's prompting skill.
A four-agent evaluator on a locally hosted Qwen 2.5-7B-Instruct judge scores each
prompt as an artifact before any response exists, then scores the resulting
response twice on identical items: once against criteria… See the full description on the dataset page: https://huggingface.co/datasets/shahoismael/prompt-quality-vs-response-compliance.prompt-response-llmrouterbenchpersonalization_prompt_response_euruspersonalization_prompt_response_oasst_pythia_1bseq_prompt_response_bidpersonalization_prompt_response_gemma_2bpersonalization_prompt_response_mistral_raftpersonalization_prompt_response_oasst_pythia_7bpersonalization_prompt_response_llama3_sfairxpersonalization_prompt_response_starling_34Bprompt_responses_formal_conciseprompt_responses_formal_concise_activationsprompt_responses_safe_helpful_activationspersonalization_prompt_response_mistralpersonalization_prompt_response_mistral_weqweasdaspersonalization_prompt_response_mistral_raypersonalization_prompt_response_gemma_7bpersonalization_prompt_response_mistral_dpapersonalization_prompt_response_ziya_llama_7bpersonalization_prompt_response_oasst_deberta_v3_oldpersonalization_prompt_response_beaver_7bpersonalization_prompt_response_oasst_deberta_v3
