AirsideLabs/NOTAM_Coverage
023
1---2dataset_info:3- config_name: chunked4 features:5 - name: document_id6 dtype: string7 - name: document_text8 dtype: string9 - name: document_filename10 dtype: string11 - name: document_metadata12 struct:13 - name: file_size14 dtype: int6415 - name: raw_chunk_summaries16 sequence: string17 - name: chunk_summaries18 sequence: string19 - name: raw_document_summary20 dtype: string21 - name: document_summary22 dtype: string23 - name: summarization_model24 dtype: string25 - name: chunks26 list:27 - name: chunk_id28 dtype: string29 - name: chunk_text30 dtype: string31 - name: multihop_chunks32 list:33 - name: chunk_ids34 sequence: string35 - name: chunks_text36 sequence: string37 - name: chunk_info_metrics38 list:39 - name: avg_token_length40 dtype: float6441 - name: bigram_diversity42 dtype: float6443 - name: flesch_reading_ease44 dtype: float6445 - name: gunning_fog46 dtype: float6447 - name: perplexity48 dtype: float6449 - name: token_count50 dtype: float6451 - name: unique_token_ratio52 dtype: float6453 - name: chunking_model54 dtype: string55 splits:56 - name: train57 num_bytes: 121906858 num_examples: 259 download_size: 61429060 dataset_size: 121906861- config_name: coverage_mapping62 features:63 - name: question_id64 dtype: string65 - name: question66 dtype: string67 - name: source68 dtype: string69 - name: mappings70 list:71 - name: coverage_score72 dtype: int6473 - name: rationale74 dtype: string75 - name: relationship_type76 dtype: string77 - name: test_effectiveness78 dtype: string79 - name: tested_criteria80 sequence: string81 - name: use_case_id82 dtype: string83 splits:84 - name: train85 num_bytes: 156446186 num_examples: 187187 download_size: 35586088 dataset_size: 156446189- config_name: ingested90 features:91 - name: document_id92 dtype: string93 - name: document_text94 dtype: string95 - name: document_filename96 dtype: string97 - name: document_metadata98 struct:99 - name: file_size100 dtype: int64101 splits:102 - name: train103 num_bytes: 412034104 num_examples: 2105 download_size: 194596106 dataset_size: 412034107- config_name: lighteval108 features:109 - name: question110 dtype: string111 - name: additional_instructions112 dtype: string113 - name: ground_truth_answer114 dtype: string115 - name: gold116 dtype: string117 - name: choices118 sequence: 'null'119 - name: question_category120 dtype: string121 - name: kind122 dtype: string123 - name: estimated_difficulty124 dtype: int64125 - name: citations126 sequence: string127 - name: document_id128 dtype: string129 - name: chunk_ids130 sequence: string131 - name: question_generating_model132 dtype: string133 - name: chunks134 sequence: string135 - name: document136 dtype: string137 - name: document_summary138 dtype: string139 splits:140 - name: train141 num_bytes: 658604285142 num_examples: 1871143 download_size: 1234627144 dataset_size: 658604285145- config_name: multi_hop_questions146 features:147 - name: document_id148 dtype: string149 - name: source_chunk_ids150 sequence: string151 - name: additional_instructions152 dtype: string153 - name: question154 dtype: string155 - name: self_answer156 dtype: string157 - name: choices158 sequence: 'null'159 - name: estimated_difficulty160 dtype: int64161 - name: self_assessed_question_type162 dtype: string163 - name: generating_model164 dtype: string165 - name: thought_process166 dtype: string167 - name: citations168 sequence: string169 - name: raw_response170 dtype: string171 splits:172 - name: train173 num_bytes: 1509876174 num_examples: 218175 download_size: 284563176 dataset_size: 1509876177- config_name: single_shot_questions178 features:179 - name: chunk_id180 dtype: string181 - name: document_id182 dtype: string183 - name: additional_instructions184 dtype: string185 - name: question186 dtype: string187 - name: self_answer188 dtype: string189 - name: choices190 sequence: 'null'191 - name: estimated_difficulty192 dtype: int64193 - name: self_assessed_question_type194 dtype: string195 - name: generating_model196 dtype: string197 - name: thought_process198 dtype: string199 - name: raw_response200 dtype: string201 - name: citations202 sequence: string203 splits:204 - name: train205 num_bytes: 8062935206 num_examples: 1653207 download_size: 1102808208 dataset_size: 8062935209- config_name: summarized210 features:211 - name: document_id212 dtype: string213 - name: document_text214 dtype: string215 - name: document_filename216 dtype: string217 - name: document_metadata218 struct:219 - name: file_size220 dtype: int64221 - name: raw_chunk_summaries222 sequence: string223 - name: chunk_summaries224 sequence: string225 - name: raw_document_summary226 dtype: string227 - name: document_summary228 dtype: string229 - name: summarization_model230 dtype: string231 splits:232 - name: train233 num_bytes: 446364234 num_examples: 2235 download_size: 238246236 dataset_size: 446364237- config_name: use_cases238 features:239 - name: id240 dtype: string241 - name: title242 dtype: string243 - name: description244 dtype: string245 - name: actors246 sequence: string247 - name: preconditions248 sequence: string249 - name: postconditions250 sequence: string251 - name: main_flow252 sequence: string253 - name: alternative_flows254 sequence: string255 - name: acceptance_criteria256 sequence: string257 - name: related_requirements258 sequence: string259 splits:260 - name: train261 num_bytes: 7673262 num_examples: 8263 download_size: 11705264 dataset_size: 7673265configs:266- config_name: chunked267 data_files:268 - split: train269 path: chunked/train-*270- config_name: coverage_mapping271 data_files:272 - split: train273 path: coverage_mapping/train-*274- config_name: ingested275 data_files:276 - split: train277 path: ingested/train-*278- config_name: lighteval279 data_files:280 - split: train281 path: lighteval/train-*282- config_name: multi_hop_questions283 data_files:284 - split: train285 path: multi_hop_questions/train-*286- config_name: single_shot_questions287 data_files:288 - split: train289 path: single_shot_questions/train-*290- config_name: summarized291 data_files:292 - split: train293 path: summarized/train-*294- config_name: use_cases295 data_files:296 - split: train297 path: use_cases/train-*298---299 