nyu-dice-lab/lm-eval-results-princeton-nlp-Llama-3-Base-8B-SFT-RDPO-private
Dataset Card for Evaluation run of princeton-nlp/Llama-3-Base-8B-SFT-RDPO Dataset automatically created during the evaluation run of model princeton-nlp/Llama-3-Base-8B-SFT-RDPO The dataset is composed of 62 configuration(s), each one corresponding to one of the evaluated task. The dataset has been created from 7 run(s). Each run can be found as a specific split in each configuration, the split being named using the timestamp of the run.The "train" split is always pointing to… See the full description on the dataset page: https://huggingface.co/datasets/nyu-dice-lab/lm-eval-results-princeton-nlp-Llama-3-Base-8B-SFT-RDPO-private.
Upload README.md with huggingface_hub
Adding samples results for xstest to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for wmdp_cyber to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for wmdp_chem to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for wmdp_bio to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for toxigen to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_musr_team_allocation to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_musr_object_placements to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_musr_murder_mysteries to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_mmlu_pro to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_precalculus_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_prealgebra_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_num_theory_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_intermediate_algebra_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_geometry_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_counting_and_prob_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_math_algebra_hard to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_ifeval to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_gpqa_main to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_gpqa_extended to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_gpqa_diamond to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_web_of_lies to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_tracking_shuffled_objects_three_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_tracking_shuffled_objects_seven_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_tracking_shuffled_objects_five_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_temporal_sequences to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_sports_understanding to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_snarks to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_salient_translation_error_detection to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_ruin_names to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_reasoning_about_colored_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_penguins_in_a_table to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_object_counting to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_navigate to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_movie_recommendation to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_logical_deduction_three_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_logical_deduction_seven_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_logical_deduction_five_objects to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_hyperbaton to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_geometric_shapes to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_formal_fallacies to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_disambiguation_qa to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_date_understanding to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_causal_judgement to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for leaderboard_bbh_boolean_expressions to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for bbq_sexualorientation to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for bbq_ses to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for bbq_religion to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for bbq_racexses to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
Adding samples results for bbq_racexgender to princeton-nlp/Llama-3-Base-8B-SFT-RDPO
