datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
InferBench-evaluation-resultsevaluation-results-task1HumanAgencyBench_Evaluation_Results
HumanAgencyBench evaluation results
Paper: HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants
Code: https://github.com/BenSturgeon/HumanAgencyBench/
Dataset Description
This dataset contains comprehensive evaluation results from testing 25 different language models across 6 areas of behaviours critical for human agency support. Each model was evaluated on 3,000 prompts (500 per category), resulting in 75,000 total evaluations designed… See the full description on the dataset page: https://huggingface.co/datasets/Experimental-Orange/HumanAgencyBench_Evaluation_Results.garchen_rinpoche_evaluation_results_latesthugging-face-LLM-evaluation-results
Dataset Summary
Data comes from hugging face evaluation results using the https://github.com/EleutherAI/lm-evaluation-harness . See https://huggingface.co/datasets/open-llm-leaderboard/results for full results.
sinergi-model-evaluation-results
Sinergi model evaluation outputs
Model answers and generation telemetry used by the Sinergi Table 8-aligned evaluation notebook. The repository contains eight configurations so every system can be loaded independently with the Hugging Face datasets library.
from datasets import load_dataset
data = load_dataset(
"Legal-verse/sinergi-model-evaluation-results",
"qwen-sft-rl-rag",
split="test",
)
Configurations
Configuration
System
Rows
Source file… See the full description on the dataset page: https://huggingface.co/datasets/Legal-verse/sinergi-model-evaluation-results.TwinLlama-3.1-8B-evaluation-resultsaime24-evaluation-results_4625_seed-1Meta-Llama-3.1-8B-Instruct-evaluation-resultsskripsi-qg-evaluation-resultsaime24-evaluation-resultsaime24-evaluation-results_vllm_exp_152223_seed-0aime24-evaluation-results_vllm_exp_152223_seed-2aime24-evaluation-results_seed-1aime24-evaluation-results_2321_seed-0aime24-evaluation-results_vllm_ex-3_seed-2aime24-evaluation-results_seed-0aime24-evaluation-results_seed-2aime24-evaluation-results_4625_seed-0aime24-evaluation-results_vllm_ex-3_seed-1customerservice-Human-evaluation-results-evaluator_2Model_Evaluation_ResultsTwinLlama-3.1-8B-DPO-evaluation-resultsaime24-evaluation-results_vllm_ex-3_seed-0customerservice-Human-evaluation-results-evaluator_3customerservice-Human-evaluation-results-overallgarchen_rinpoche_evaluation_resultscustomerservice-Human-evaluation-results-evaluator_1aime24-evaluation-results_vllm_exp_152223_seed-1rm_evaluation_results_4
