CoolFace
Datasetpublic

TAUR-dev/D-EVAL__standard_eval_v3__jack_test_workflow-eval

D-EVAL__standard_eval_v3__jack_test_workflow-eval This evaluation dataset was created as part of the jack_test_workflow experiment using the SkillFactory experiment management system. Experiment Tracking ๐Ÿ”— View complete experiment details: Experiment Tracker Dataset Evaluation Details {"model": "TAUR-dev/M-jack_test_workflow-rl", "tasks": ["countdown_2arg"], "annotators": ["greedy"], "splits": ["test"], "dataset_url":โ€ฆ See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-EVAL__standard_eval_v3__jack_test_workflow-eval.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes18downloads
README.md354 linesDownload Raw Back to root
1---2dataset_info:3- config_name: latest4  features:5  - name: question6    dtype: string7  - name: answer8    dtype: string9  - name: task_config10    dtype: string11  - name: task_source12    dtype: string13  - name: prompt14    list:15    - name: content16      dtype: string17    - name: role18      dtype: string19  - name: model_responses20    sequence: 'null'21  - name: model_responses__eval_is_correct22    sequence: 'null'23  - name: all_other_columns24    dtype: string25  - name: original_split26    dtype: string27  - name: metadata28    dtype: string29  - name: model_responses__greedy30    sequence: string31  - name: model_responses__greedy__finish_reason_length_flags32    sequence: bool33  - name: model_responses__greedy__length_partial_responses34    sequence: string35  - name: prompt__greedy__metadata36    dtype: string37  - name: model_responses__greedy__metadata38    dtype: string39  - name: model_responses__greedy__eval_is_correct40    sequence: bool41  - name: model_responses__greedy__eval_extracted_answers42    sequence: string43  - name: model_responses__greedy__eval_extraction_metadata44    dtype: string45  - name: model_responses__greedy__eval_evaluation_metadata46    dtype: string47  - name: model_responses__greedy__internal_answers__eval_is_correct48    sequence:49      sequence: bool50  - name: model_responses__greedy__internal_answers__eval_extracted_answers51    sequence:52      sequence: string53  - name: model_responses__greedy__internal_answers__eval_extraction_metadata54    dtype: string55  - name: model_responses__greedy__internal_answers__eval_evaluation_metadata56    dtype: string57  - name: model_responses__greedy__metrics58    struct:59    - name: flips_by60      sequence: int6461    - name: flips_total62      dtype: int6463    - name: num_correct64      dtype: int6465    - name: pass_at_n66      dtype: 'null'67    - name: percent_correct68      dtype: 'null'69    - name: skill_count70      struct:71      - name: answer_revision72        sequence: int6473      - name: best_of_n74        sequence: int6475      - name: reflection_sbon76        sequence: int6477      - name: voting78        sequence: int6479    - name: total_responses80      dtype: int6481  - name: eval_date82    dtype: string83  splits:84  - name: test85    num_bytes: 135016286    num_examples: 25087  download_size: 23314588  dataset_size: 135016289- config_name: older_190  features:91  - name: question92    dtype: string93  - name: answer94    dtype: string95  - name: task_config96    dtype: string97  - name: task_source98    dtype: string99  - name: prompt100    list:101    - name: content102      dtype: string103    - name: role104      dtype: string105  - name: model_responses106    sequence: 'null'107  - name: model_responses__eval_is_correct108    sequence: 'null'109  - name: all_other_columns110    dtype: string111  - name: original_split112    dtype: string113  - name: metadata114    dtype: string115  - name: model_responses__greedy116    sequence: string117  - name: prompt__greedy__metadata118    dtype: string119  - name: model_responses__greedy__metadata120    dtype: string121  - name: model_responses__greedy__eval_is_correct122    sequence: bool123  - name: model_responses__greedy__eval_extracted_answers124    sequence: string125  - name: model_responses__greedy__eval_extraction_metadata126    dtype: string127  - name: model_responses__greedy__eval_evaluation_metadata128    dtype: string129  - name: model_responses__greedy__internal_answers__eval_is_correct130    sequence:131      sequence: bool132  - name: model_responses__greedy__internal_answers__eval_extracted_answers133    sequence:134      sequence: string135  - name: model_responses__greedy__internal_answers__eval_extraction_metadata136    dtype: string137  - name: model_responses__greedy__internal_answers__eval_evaluation_metadata138    dtype: string139  - name: eval_date140    dtype: string141  splits:142  - name: test143    num_bytes: 1297924144    num_examples: 250145  download_size: 219719146  dataset_size: 1297924147- config_name: older_2148  features:149  - name: question150    dtype: string151  - name: answer152    dtype: string153  - name: task_config154    dtype: string155  - name: task_source156    dtype: string157  - name: prompt158    list:159    - name: content160      dtype: string161    - name: role162      dtype: string163  - name: model_responses164    sequence: 'null'165  - name: model_responses__eval_is_correct166    sequence: 'null'167  - name: all_other_columns168    dtype: string169  - name: original_split170    dtype: string171  - name: metadata172    dtype: string173  - name: model_responses__greedy174    sequence: string175  - name: prompt__greedy__metadata176    dtype: string177  - name: model_responses__greedy__metadata178    dtype: string179  - name: model_responses__greedy__eval_is_correct180    sequence: bool181  - name: model_responses__greedy__eval_extracted_answers182    sequence: string183  - name: model_responses__greedy__eval_extraction_metadata184    dtype: string185  - name: model_responses__greedy__eval_evaluation_metadata186    dtype: string187  - name: model_responses__greedy__internal_answers__eval_is_correct188    sequence:189      sequence: bool190  - name: model_responses__greedy__internal_answers__eval_extracted_answers191    sequence:192      sequence: string193  - name: model_responses__greedy__internal_answers__eval_extraction_metadata194    dtype: string195  - name: model_responses__greedy__internal_answers__eval_evaluation_metadata196    dtype: string197  - name: eval_date198    dtype: string199  splits:200  - name: test201    num_bytes: 1313141202    num_examples: 250203  download_size: 225733204  dataset_size: 1313141205- config_name: older_3206  features:207  - name: question208    dtype: string209  - name: answer210    dtype: string211  - name: task_config212    dtype: string213  - name: task_source214    dtype: string215  - name: prompt216    list:217    - name: content218      dtype: string219    - name: role220      dtype: string221  - name: model_responses222    sequence: 'null'223  - name: model_responses__eval_is_correct224    sequence: 'null'225  - name: all_other_columns226    dtype: string227  - name: original_split228    dtype: string229  - name: metadata230    dtype: string231  - name: model_responses__greedy232    sequence: string233  - name: prompt__greedy__metadata234    dtype: string235  - name: model_responses__greedy__metadata236    dtype: string237  - name: model_responses__greedy__eval_is_correct238    sequence: bool239  - name: model_responses__greedy__eval_extracted_answers240    sequence: string241  - name: model_responses__greedy__eval_extraction_metadata242    dtype: string243  - name: model_responses__greedy__eval_evaluation_metadata244    dtype: string245  - name: model_responses__greedy__internal_answers__eval_is_correct246    sequence:247      sequence: bool248  - name: model_responses__greedy__internal_answers__eval_extracted_answers249    sequence:250      sequence: string251  - name: model_responses__greedy__internal_answers__eval_extraction_metadata252    dtype: string253  - name: model_responses__greedy__internal_answers__eval_evaluation_metadata254    dtype: string255  - name: eval_date256    dtype: string257  splits:258  - name: test259    num_bytes: 1306408260    num_examples: 250261  download_size: 217032262  dataset_size: 1306408263- config_name: older_4264  features:265  - name: question266    dtype: string267  - name: answer268    dtype: string269  - name: task_config270    dtype: string271  - name: task_source272    dtype: string273  - name: prompt274    list:275    - name: content276      dtype: string277    - name: role278      dtype: string279  - name: model_responses280    sequence: 'null'281  - name: model_responses__eval_is_correct282    sequence: 'null'283  - name: all_other_columns284    dtype: string285  - name: original_split286    dtype: string287  - name: metadata288    dtype: string289  - name: model_responses__greedy290    sequence: string291  - name: prompt__greedy__metadata292    dtype: string293  - name: model_responses__greedy__metadata294    dtype: string295  - name: model_responses__greedy__eval_is_correct296    sequence: bool297  - name: model_responses__greedy__eval_extracted_answers298    sequence: string299  - name: model_responses__greedy__eval_extraction_metadata300    dtype: string301  - name: model_responses__greedy__eval_evaluation_metadata302    dtype: string303  - name: model_responses__greedy__internal_answers__eval_is_correct304    sequence:305      sequence: bool306  - name: model_responses__greedy__internal_answers__eval_extracted_answers307    sequence:308      sequence: string309  - name: model_responses__greedy__internal_answers__eval_extraction_metadata310    dtype: string311  - name: model_responses__greedy__internal_answers__eval_evaluation_metadata312    dtype: string313  - name: eval_date314    dtype: string315  splits:316  - name: test317    num_bytes: 1280264318    num_examples: 250319  download_size: 210652320  dataset_size: 1280264321configs:322- config_name: latest323  data_files:324  - split: test325    path: latest/test-*326- config_name: older_1327  data_files:328  - split: test329    path: older_1/test-*330- config_name: older_2331  data_files:332  - split: test333    path: older_2/test-*334- config_name: older_3335  data_files:336  - split: test337    path: older_3/test-*338- config_name: older_4339  data_files:340  - split: test341    path: older_4/test-*342---343# D-EVAL__standard_eval_v3__jack_test_workflow-eval344 345This evaluation dataset was created as part of the **jack_test_workflow** experiment using the SkillFactory experiment management system.346 347## Experiment Tracking348 349๐Ÿ”— **View complete experiment details**: [Experiment Tracker Dataset](https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__jack_test_workflow__v1)350 351## Evaluation Details352 353{"model": "TAUR-dev/M-jack_test_workflow-rl", "tasks": ["countdown_2arg"], "annotators": ["greedy"], "splits": ["test"], "dataset_url": "TAUR-dev/D-DATA-canonical_dataset_splits-v1-7_13_25", "stage_name": "eval", "upload_to_separate_repo": true, "mutate_prompt_for_answer_tags": true}354