CoolFace
Datasetpublic

sasha/ipcc_docs_test

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes52downloads
README.md241 linesDownload Raw Back to root
1---2dataset_info:3- config_name: chunked4  features:5  - name: document_id6    dtype: string7  - name: document_text8    dtype: string9  - name: document_filename10    dtype: string11  - name: document_metadata12    struct:13    - name: file_size14      dtype: int6415  - name: raw_chunk_summaries16    sequence: string17  - name: chunk_summaries18    sequence: string19  - name: raw_document_summary20    dtype: string21  - name: document_summary22    dtype: string23  - name: summarization_model24    dtype: string25  - name: chunks26    list:27    - name: chunk_id28      dtype: string29    - name: chunk_text30      dtype: string31  - name: multihop_chunks32    list:33    - name: chunk_ids34      sequence: string35    - name: chunks_text36      sequence: string37  - name: chunk_info_metrics38    list:39    - name: avg_token_length40      dtype: float6441    - name: bigram_diversity42      dtype: float6443    - name: flesch_reading_ease44      dtype: float6445    - name: gunning_fog46      dtype: float6447    - name: perplexity48      dtype: float6449    - name: token_count50      dtype: float6451    - name: unique_token_ratio52      dtype: float6453  - name: chunking_model54    dtype: string55  splits:56  - name: train57    num_bytes: 103141158    num_examples: 159  download_size: 56502460  dataset_size: 103141161- config_name: ingested62  features:63  - name: document_id64    dtype: string65  - name: document_text66    dtype: string67  - name: document_filename68    dtype: string69  - name: document_metadata70    struct:71    - name: file_size72      dtype: int6473  splits:74  - name: train75    num_bytes: 36388576    num_examples: 177  download_size: 18642578  dataset_size: 36388579- config_name: lighteval80  features:81  - name: question82    dtype: string83  - name: additional_instructions84    dtype: string85  - name: ground_truth_answer86    dtype: string87  - name: gold88    sequence: string89  - name: choices90    sequence: 'null'91  - name: question_category92    dtype: string93  - name: kind94    dtype: string95  - name: estimated_difficulty96    dtype: int6497  - name: citations98    sequence: string99  - name: document_id100    dtype: string101  - name: chunk_ids102    sequence: string103  - name: question_generating_model104    dtype: string105  - name: chunks106    sequence: string107  - name: document108    dtype: string109  - name: document_summary110    dtype: string111  - name: answer_citation_score112    dtype: float64113  - name: chunk_citation_score114    dtype: float64115  - name: citation_score116    dtype: float64117  splits:118  - name: train119    num_bytes: 24921294120    num_examples: 67121  download_size: 308968122  dataset_size: 24921294123- config_name: multi_hop_questions124  features:125  - name: document_id126    dtype: string127  - name: source_chunk_ids128    sequence: string129  - name: additional_instructions130    dtype: string131  - name: question132    dtype: string133  - name: self_answer134    dtype: string135  - name: choices136    sequence: 'null'137  - name: estimated_difficulty138    dtype: int64139  - name: self_assessed_question_type140    dtype: string141  - name: generating_model142    dtype: string143  - name: thought_process144    dtype: string145  - name: citations146    sequence: string147  - name: raw_response148    dtype: string149  splits:150  - name: train151    num_bytes: 418851152    num_examples: 42153  download_size: 80808154  dataset_size: 418851155- config_name: single_shot_questions156  features:157  - name: chunk_id158    dtype: string159  - name: document_id160    dtype: string161  - name: additional_instructions162    dtype: string163  - name: question164    dtype: string165  - name: self_answer166    dtype: string167  - name: choices168    sequence: 'null'169  - name: estimated_difficulty170    dtype: int64171  - name: self_assessed_question_type172    dtype: string173  - name: generating_model174    dtype: string175  - name: thought_process176    dtype: string177  - name: raw_response178    dtype: string179  - name: citations180    sequence: string181  splits:182  - name: train183    num_bytes: 193269184    num_examples: 25185  download_size: 34372186  dataset_size: 193269187- config_name: summarized188  features:189  - name: document_id190    dtype: string191  - name: document_text192    dtype: string193  - name: document_filename194    dtype: string195  - name: document_metadata196    struct:197    - name: file_size198      dtype: int64199  - name: raw_chunk_summaries200    sequence: string201  - name: chunk_summaries202    sequence: string203  - name: raw_document_summary204    dtype: string205  - name: document_summary206    dtype: string207  - name: summarization_model208    dtype: string209  splits:210  - name: train211    num_bytes: 387704212    num_examples: 1213  download_size: 228140214  dataset_size: 387704215configs:216- config_name: chunked217  data_files:218  - split: train219    path: chunked/train-*220- config_name: ingested221  data_files:222  - split: train223    path: ingested/train-*224- config_name: lighteval225  data_files:226  - split: train227    path: lighteval/train-*228- config_name: multi_hop_questions229  data_files:230  - split: train231    path: multi_hop_questions/train-*232- config_name: single_shot_questions233  data_files:234  - split: train235    path: single_shot_questions/train-*236- config_name: summarized237  data_files:238  - split: train239    path: summarized/train-*240---241