sasha/ipcc_docs_test
052
1---2dataset_info:3- config_name: chunked4 features:5 - name: document_id6 dtype: string7 - name: document_text8 dtype: string9 - name: document_filename10 dtype: string11 - name: document_metadata12 struct:13 - name: file_size14 dtype: int6415 - name: raw_chunk_summaries16 sequence: string17 - name: chunk_summaries18 sequence: string19 - name: raw_document_summary20 dtype: string21 - name: document_summary22 dtype: string23 - name: summarization_model24 dtype: string25 - name: chunks26 list:27 - name: chunk_id28 dtype: string29 - name: chunk_text30 dtype: string31 - name: multihop_chunks32 list:33 - name: chunk_ids34 sequence: string35 - name: chunks_text36 sequence: string37 - name: chunk_info_metrics38 list:39 - name: avg_token_length40 dtype: float6441 - name: bigram_diversity42 dtype: float6443 - name: flesch_reading_ease44 dtype: float6445 - name: gunning_fog46 dtype: float6447 - name: perplexity48 dtype: float6449 - name: token_count50 dtype: float6451 - name: unique_token_ratio52 dtype: float6453 - name: chunking_model54 dtype: string55 splits:56 - name: train57 num_bytes: 103141158 num_examples: 159 download_size: 56502460 dataset_size: 103141161- config_name: ingested62 features:63 - name: document_id64 dtype: string65 - name: document_text66 dtype: string67 - name: document_filename68 dtype: string69 - name: document_metadata70 struct:71 - name: file_size72 dtype: int6473 splits:74 - name: train75 num_bytes: 36388576 num_examples: 177 download_size: 18642578 dataset_size: 36388579- config_name: lighteval80 features:81 - name: question82 dtype: string83 - name: additional_instructions84 dtype: string85 - name: ground_truth_answer86 dtype: string87 - name: gold88 sequence: string89 - name: choices90 sequence: 'null'91 - name: question_category92 dtype: string93 - name: kind94 dtype: string95 - name: estimated_difficulty96 dtype: int6497 - name: citations98 sequence: string99 - name: document_id100 dtype: string101 - name: chunk_ids102 sequence: string103 - name: question_generating_model104 dtype: string105 - name: chunks106 sequence: string107 - name: document108 dtype: string109 - name: document_summary110 dtype: string111 - name: answer_citation_score112 dtype: float64113 - name: chunk_citation_score114 dtype: float64115 - name: citation_score116 dtype: float64117 splits:118 - name: train119 num_bytes: 24921294120 num_examples: 67121 download_size: 308968122 dataset_size: 24921294123- config_name: multi_hop_questions124 features:125 - name: document_id126 dtype: string127 - name: source_chunk_ids128 sequence: string129 - name: additional_instructions130 dtype: string131 - name: question132 dtype: string133 - name: self_answer134 dtype: string135 - name: choices136 sequence: 'null'137 - name: estimated_difficulty138 dtype: int64139 - name: self_assessed_question_type140 dtype: string141 - name: generating_model142 dtype: string143 - name: thought_process144 dtype: string145 - name: citations146 sequence: string147 - name: raw_response148 dtype: string149 splits:150 - name: train151 num_bytes: 418851152 num_examples: 42153 download_size: 80808154 dataset_size: 418851155- config_name: single_shot_questions156 features:157 - name: chunk_id158 dtype: string159 - name: document_id160 dtype: string161 - name: additional_instructions162 dtype: string163 - name: question164 dtype: string165 - name: self_answer166 dtype: string167 - name: choices168 sequence: 'null'169 - name: estimated_difficulty170 dtype: int64171 - name: self_assessed_question_type172 dtype: string173 - name: generating_model174 dtype: string175 - name: thought_process176 dtype: string177 - name: raw_response178 dtype: string179 - name: citations180 sequence: string181 splits:182 - name: train183 num_bytes: 193269184 num_examples: 25185 download_size: 34372186 dataset_size: 193269187- config_name: summarized188 features:189 - name: document_id190 dtype: string191 - name: document_text192 dtype: string193 - name: document_filename194 dtype: string195 - name: document_metadata196 struct:197 - name: file_size198 dtype: int64199 - name: raw_chunk_summaries200 sequence: string201 - name: chunk_summaries202 sequence: string203 - name: raw_document_summary204 dtype: string205 - name: document_summary206 dtype: string207 - name: summarization_model208 dtype: string209 splits:210 - name: train211 num_bytes: 387704212 num_examples: 1213 download_size: 228140214 dataset_size: 387704215configs:216- config_name: chunked217 data_files:218 - split: train219 path: chunked/train-*220- config_name: ingested221 data_files:222 - split: train223 path: ingested/train-*224- config_name: lighteval225 data_files:226 - split: train227 path: lighteval/train-*228- config_name: multi_hop_questions229 data_files:230 - split: train231 path: multi_hop_questions/train-*232- config_name: single_shot_questions233 data_files:234 - split: train235 path: single_shot_questions/train-*236- config_name: summarized237 data_files:238 - split: train239 path: summarized/train-*240---241 