TAUR-dev/D-EVAL__standard_eval_v3__jack_test_workflow-eval
D-EVAL__standard_eval_v3__jack_test_workflow-eval This evaluation dataset was created as part of the jack_test_workflow experiment using the SkillFactory experiment management system. Experiment Tracking ๐ View complete experiment details: Experiment Tracker Dataset Evaluation Details {"model": "TAUR-dev/M-jack_test_workflow-rl", "tasks": ["countdown_2arg"], "annotators": ["greedy"], "splits": ["test"], "dataset_url":โฆ See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-EVAL__standard_eval_v3__jack_test_workflow-eval.
018
1---2dataset_info:3- config_name: latest4 features:5 - name: question6 dtype: string7 - name: answer8 dtype: string9 - name: task_config10 dtype: string11 - name: task_source12 dtype: string13 - name: prompt14 list:15 - name: content16 dtype: string17 - name: role18 dtype: string19 - name: model_responses20 sequence: 'null'21 - name: model_responses__eval_is_correct22 sequence: 'null'23 - name: all_other_columns24 dtype: string25 - name: original_split26 dtype: string27 - name: metadata28 dtype: string29 - name: model_responses__greedy30 sequence: string31 - name: model_responses__greedy__finish_reason_length_flags32 sequence: bool33 - name: model_responses__greedy__length_partial_responses34 sequence: string35 - name: prompt__greedy__metadata36 dtype: string37 - name: model_responses__greedy__metadata38 dtype: string39 - name: model_responses__greedy__eval_is_correct40 sequence: bool41 - name: model_responses__greedy__eval_extracted_answers42 sequence: string43 - name: model_responses__greedy__eval_extraction_metadata44 dtype: string45 - name: model_responses__greedy__eval_evaluation_metadata46 dtype: string47 - name: model_responses__greedy__internal_answers__eval_is_correct48 sequence:49 sequence: bool50 - name: model_responses__greedy__internal_answers__eval_extracted_answers51 sequence:52 sequence: string53 - name: model_responses__greedy__internal_answers__eval_extraction_metadata54 dtype: string55 - name: model_responses__greedy__internal_answers__eval_evaluation_metadata56 dtype: string57 - name: model_responses__greedy__metrics58 struct:59 - name: flips_by60 sequence: int6461 - name: flips_total62 dtype: int6463 - name: num_correct64 dtype: int6465 - name: pass_at_n66 dtype: 'null'67 - name: percent_correct68 dtype: 'null'69 - name: skill_count70 struct:71 - name: answer_revision72 sequence: int6473 - name: best_of_n74 sequence: int6475 - name: reflection_sbon76 sequence: int6477 - name: voting78 sequence: int6479 - name: total_responses80 dtype: int6481 - name: eval_date82 dtype: string83 splits:84 - name: test85 num_bytes: 135016286 num_examples: 25087 download_size: 23314588 dataset_size: 135016289- config_name: older_190 features:91 - name: question92 dtype: string93 - name: answer94 dtype: string95 - name: task_config96 dtype: string97 - name: task_source98 dtype: string99 - name: prompt100 list:101 - name: content102 dtype: string103 - name: role104 dtype: string105 - name: model_responses106 sequence: 'null'107 - name: model_responses__eval_is_correct108 sequence: 'null'109 - name: all_other_columns110 dtype: string111 - name: original_split112 dtype: string113 - name: metadata114 dtype: string115 - name: model_responses__greedy116 sequence: string117 - name: prompt__greedy__metadata118 dtype: string119 - name: model_responses__greedy__metadata120 dtype: string121 - name: model_responses__greedy__eval_is_correct122 sequence: bool123 - name: model_responses__greedy__eval_extracted_answers124 sequence: string125 - name: model_responses__greedy__eval_extraction_metadata126 dtype: string127 - name: model_responses__greedy__eval_evaluation_metadata128 dtype: string129 - name: model_responses__greedy__internal_answers__eval_is_correct130 sequence:131 sequence: bool132 - name: model_responses__greedy__internal_answers__eval_extracted_answers133 sequence:134 sequence: string135 - name: model_responses__greedy__internal_answers__eval_extraction_metadata136 dtype: string137 - name: model_responses__greedy__internal_answers__eval_evaluation_metadata138 dtype: string139 - name: eval_date140 dtype: string141 splits:142 - name: test143 num_bytes: 1297924144 num_examples: 250145 download_size: 219719146 dataset_size: 1297924147- config_name: older_2148 features:149 - name: question150 dtype: string151 - name: answer152 dtype: string153 - name: task_config154 dtype: string155 - name: task_source156 dtype: string157 - name: prompt158 list:159 - name: content160 dtype: string161 - name: role162 dtype: string163 - name: model_responses164 sequence: 'null'165 - name: model_responses__eval_is_correct166 sequence: 'null'167 - name: all_other_columns168 dtype: string169 - name: original_split170 dtype: string171 - name: metadata172 dtype: string173 - name: model_responses__greedy174 sequence: string175 - name: prompt__greedy__metadata176 dtype: string177 - name: model_responses__greedy__metadata178 dtype: string179 - name: model_responses__greedy__eval_is_correct180 sequence: bool181 - name: model_responses__greedy__eval_extracted_answers182 sequence: string183 - name: model_responses__greedy__eval_extraction_metadata184 dtype: string185 - name: model_responses__greedy__eval_evaluation_metadata186 dtype: string187 - name: model_responses__greedy__internal_answers__eval_is_correct188 sequence:189 sequence: bool190 - name: model_responses__greedy__internal_answers__eval_extracted_answers191 sequence:192 sequence: string193 - name: model_responses__greedy__internal_answers__eval_extraction_metadata194 dtype: string195 - name: model_responses__greedy__internal_answers__eval_evaluation_metadata196 dtype: string197 - name: eval_date198 dtype: string199 splits:200 - name: test201 num_bytes: 1313141202 num_examples: 250203 download_size: 225733204 dataset_size: 1313141205- config_name: older_3206 features:207 - name: question208 dtype: string209 - name: answer210 dtype: string211 - name: task_config212 dtype: string213 - name: task_source214 dtype: string215 - name: prompt216 list:217 - name: content218 dtype: string219 - name: role220 dtype: string221 - name: model_responses222 sequence: 'null'223 - name: model_responses__eval_is_correct224 sequence: 'null'225 - name: all_other_columns226 dtype: string227 - name: original_split228 dtype: string229 - name: metadata230 dtype: string231 - name: model_responses__greedy232 sequence: string233 - name: prompt__greedy__metadata234 dtype: string235 - name: model_responses__greedy__metadata236 dtype: string237 - name: model_responses__greedy__eval_is_correct238 sequence: bool239 - name: model_responses__greedy__eval_extracted_answers240 sequence: string241 - name: model_responses__greedy__eval_extraction_metadata242 dtype: string243 - name: model_responses__greedy__eval_evaluation_metadata244 dtype: string245 - name: model_responses__greedy__internal_answers__eval_is_correct246 sequence:247 sequence: bool248 - name: model_responses__greedy__internal_answers__eval_extracted_answers249 sequence:250 sequence: string251 - name: model_responses__greedy__internal_answers__eval_extraction_metadata252 dtype: string253 - name: model_responses__greedy__internal_answers__eval_evaluation_metadata254 dtype: string255 - name: eval_date256 dtype: string257 splits:258 - name: test259 num_bytes: 1306408260 num_examples: 250261 download_size: 217032262 dataset_size: 1306408263- config_name: older_4264 features:265 - name: question266 dtype: string267 - name: answer268 dtype: string269 - name: task_config270 dtype: string271 - name: task_source272 dtype: string273 - name: prompt274 list:275 - name: content276 dtype: string277 - name: role278 dtype: string279 - name: model_responses280 sequence: 'null'281 - name: model_responses__eval_is_correct282 sequence: 'null'283 - name: all_other_columns284 dtype: string285 - name: original_split286 dtype: string287 - name: metadata288 dtype: string289 - name: model_responses__greedy290 sequence: string291 - name: prompt__greedy__metadata292 dtype: string293 - name: model_responses__greedy__metadata294 dtype: string295 - name: model_responses__greedy__eval_is_correct296 sequence: bool297 - name: model_responses__greedy__eval_extracted_answers298 sequence: string299 - name: model_responses__greedy__eval_extraction_metadata300 dtype: string301 - name: model_responses__greedy__eval_evaluation_metadata302 dtype: string303 - name: model_responses__greedy__internal_answers__eval_is_correct304 sequence:305 sequence: bool306 - name: model_responses__greedy__internal_answers__eval_extracted_answers307 sequence:308 sequence: string309 - name: model_responses__greedy__internal_answers__eval_extraction_metadata310 dtype: string311 - name: model_responses__greedy__internal_answers__eval_evaluation_metadata312 dtype: string313 - name: eval_date314 dtype: string315 splits:316 - name: test317 num_bytes: 1280264318 num_examples: 250319 download_size: 210652320 dataset_size: 1280264321configs:322- config_name: latest323 data_files:324 - split: test325 path: latest/test-*326- config_name: older_1327 data_files:328 - split: test329 path: older_1/test-*330- config_name: older_2331 data_files:332 - split: test333 path: older_2/test-*334- config_name: older_3335 data_files:336 - split: test337 path: older_3/test-*338- config_name: older_4339 data_files:340 - split: test341 path: older_4/test-*342---343# D-EVAL__standard_eval_v3__jack_test_workflow-eval344 345This evaluation dataset was created as part of the **jack_test_workflow** experiment using the SkillFactory experiment management system.346 347## Experiment Tracking348 349๐ **View complete experiment details**: [Experiment Tracker Dataset](https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__jack_test_workflow__v1)350 351## Evaluation Details352 353{"model": "TAUR-dev/M-jack_test_workflow-rl", "tasks": ["countdown_2arg"], "annotators": ["greedy"], "splits": ["test"], "dataset_url": "TAUR-dev/D-DATA-canonical_dataset_splits-v1-7_13_25", "stage_name": "eval", "upload_to_separate_repo": true, "mutate_prompt_for_answer_tags": true}354 