Shuu12121/codeedit_hard_negative_datasets_kd
0564
1---2dataset_info:3- config_name: documents_bash4 features:5 - name: document_id6 dtype: string7 - name: document8 dtype: string9 - name: split10 dtype: string11 splits:12 - name: train13 num_bytes: 1086316214 num_examples: 2439115 download_size: 553588416 dataset_size: 1086316217- config_name: documents_c18 features:19 - name: document_id20 dtype: string21 - name: document22 dtype: string23 - name: split24 dtype: string25 splits:26 - name: train27 num_bytes: 220887328 num_examples: 516229 download_size: 110050530 dataset_size: 220887331- config_name: documents_c++32 features:33 - name: document_id34 dtype: string35 - name: document36 dtype: string37 - name: split38 dtype: string39 splits:40 - name: train41 num_bytes: 99840442 num_examples: 204043 download_size: 49041644 dataset_size: 99840445- config_name: documents_go46 features:47 - name: document_id48 dtype: string49 - name: document50 dtype: string51 - name: split52 dtype: string53 splits:54 - name: train55 num_bytes: 164536656 num_examples: 321457 download_size: 83425058 dataset_size: 164536659- config_name: documents_java60 features:61 - name: document_id62 dtype: string63 - name: document64 dtype: string65 - name: split66 dtype: string67 splits:68 - name: train69 num_bytes: 783010370 num_examples: 1170471 download_size: 343913772 dataset_size: 783010373- config_name: documents_javascript74 features:75 - name: document_id76 dtype: string77 - name: document78 dtype: string79 - name: split80 dtype: string81 splits:82 - name: train83 num_bytes: 3013338584 num_examples: 5039685 download_size: 1400201686 dataset_size: 3013338587- config_name: documents_php88 features:89 - name: document_id90 dtype: string91 - name: document92 dtype: string93 - name: split94 dtype: string95 splits:96 - name: train97 num_bytes: 1030698398 num_examples: 1813999 download_size: 4615471100 dataset_size: 10306983101- config_name: documents_python102 features:103 - name: document_id104 dtype: string105 - name: document106 dtype: string107 - name: split108 dtype: string109 splits:110 - name: train111 num_bytes: 23878238112 num_examples: 40751113 download_size: 11354715114 dataset_size: 23878238115- config_name: documents_ruby116 features:117 - name: document_id118 dtype: string119 - name: document120 dtype: string121 - name: split122 dtype: string123 splits:124 - name: train125 num_bytes: 30762063126 num_examples: 60376127 download_size: 14814665128 dataset_size: 30762063129- config_name: documents_rust130 features:131 - name: document_id132 dtype: string133 - name: document134 dtype: string135 - name: split136 dtype: string137 splits:138 - name: train139 num_bytes: 317861140 num_examples: 640141 download_size: 146149142 dataset_size: 317861143- config_name: documents_scala144 features:145 - name: document_id146 dtype: string147 - name: document148 dtype: string149 - name: split150 dtype: string151 splits:152 - name: train153 num_bytes: 1342487154 num_examples: 2767155 download_size: 593337156 dataset_size: 1342487157- config_name: documents_swift158 features:159 - name: document_id160 dtype: string161 - name: document162 dtype: string163 - name: split164 dtype: string165 splits:166 - name: train167 num_bytes: 1386085168 num_examples: 2210169 download_size: 592016170 dataset_size: 1386085171- config_name: documents_typescript172 features:173 - name: document_id174 dtype: string175 - name: document176 dtype: string177 - name: split178 dtype: string179 splits:180 - name: train181 num_bytes: 2262888182 num_examples: 3600183 download_size: 1014513184 dataset_size: 2262888185- config_name: queries_bash186 features:187 - name: query_id188 dtype: string189 - name: query190 dtype: string191 - name: split192 dtype: string193 splits:194 - name: train195 num_bytes: 2392708196 num_examples: 24391197 download_size: 1421894198 dataset_size: 2392708199- config_name: queries_c200 features:201 - name: query_id202 dtype: string203 - name: query204 dtype: string205 - name: split206 dtype: string207 splits:208 - name: train209 num_bytes: 654403210 num_examples: 5162211 download_size: 396287212 dataset_size: 654403213- config_name: queries_c++214 features:215 - name: query_id216 dtype: string217 - name: query218 dtype: string219 - name: split220 dtype: string221 splits:222 - name: train223 num_bytes: 266127224 num_examples: 2040225 download_size: 148458226 dataset_size: 266127227- config_name: queries_go228 features:229 - name: query_id230 dtype: string231 - name: query232 dtype: string233 - name: split234 dtype: string235 splits:236 - name: train237 num_bytes: 311061238 num_examples: 3214239 download_size: 190929240 dataset_size: 311061241- config_name: queries_java242 features:243 - name: query_id244 dtype: string245 - name: query246 dtype: string247 - name: split248 dtype: string249 splits:250 - name: train251 num_bytes: 1117782252 num_examples: 11704253 download_size: 659705254 dataset_size: 1117782255- config_name: queries_javascript256 features:257 - name: query_id258 dtype: string259 - name: query260 dtype: string261 - name: split262 dtype: string263 splits:264 - name: train265 num_bytes: 5018002266 num_examples: 50396267 download_size: 2493657268 dataset_size: 5018002269- config_name: queries_php270 features:271 - name: query_id272 dtype: string273 - name: query274 dtype: string275 - name: split276 dtype: string277 splits:278 - name: train279 num_bytes: 1584483280 num_examples: 18139281 download_size: 901849282 dataset_size: 1584483283- config_name: queries_python284 features:285 - name: query_id286 dtype: string287 - name: query288 dtype: string289 - name: split290 dtype: string291 splits:292 - name: train293 num_bytes: 4009877294 num_examples: 40751295 download_size: 2227568296 dataset_size: 4009877297- config_name: queries_ruby298 features:299 - name: query_id300 dtype: string301 - name: query302 dtype: string303 - name: split304 dtype: string305 splits:306 - name: train307 num_bytes: 5929906308 num_examples: 60376309 download_size: 3392931310 dataset_size: 5929906311- config_name: queries_rust312 features:313 - name: query_id314 dtype: string315 - name: query316 dtype: string317 - name: split318 dtype: string319 splits:320 - name: train321 num_bytes: 59896322 num_examples: 640323 download_size: 35323324 dataset_size: 59896325- config_name: queries_scala326 features:327 - name: query_id328 dtype: string329 - name: query330 dtype: string331 - name: split332 dtype: string333 splits:334 - name: train335 num_bytes: 249919336 num_examples: 2767337 download_size: 122113338 dataset_size: 249919339- config_name: queries_swift340 features:341 - name: query_id342 dtype: string343 - name: query344 dtype: string345 - name: split346 dtype: string347 splits:348 - name: train349 num_bytes: 195921350 num_examples: 2210351 download_size: 108253352 dataset_size: 195921353- config_name: queries_typescript354 features:355 - name: query_id356 dtype: string357 - name: query358 dtype: string359 - name: split360 dtype: string361 splits:362 - name: train363 num_bytes: 344261364 num_examples: 3600365 download_size: 170931366 dataset_size: 344261367- config_name: scores_bash368 features:369 - name: query_id370 dtype: string371 - name: document_ids372 sequence: string373 - name: scores374 sequence: float64375 - name: split376 dtype: string377 splits:378 - name: train379 num_bytes: 115763077380 num_examples: 24391381 download_size: 46930974382 dataset_size: 115763077383- config_name: scores_c384 features:385 - name: query_id386 dtype: string387 - name: document_ids388 sequence: string389 - name: scores390 sequence: float64391 - name: split392 dtype: string393 splits:394 - name: train395 num_bytes: 20563111396 num_examples: 5162397 download_size: 9177093398 dataset_size: 20563111399- config_name: scores_c++400 features:401 - name: query_id402 dtype: string403 - name: document_ids404 sequence: string405 - name: scores406 sequence: float64407 - name: split408 dtype: string409 splits:410 - name: train411 num_bytes: 8816269412 num_examples: 2040413 download_size: 3479821414 dataset_size: 8816269415- config_name: scores_go416 features:417 - name: query_id418 dtype: string419 - name: document_ids420 sequence: string421 - name: scores422 sequence: float64423 - name: split424 dtype: string425 splits:426 - name: train427 num_bytes: 13341589428 num_examples: 3214429 download_size: 5678148430 dataset_size: 13341589431- config_name: scores_java432 features:433 - name: query_id434 dtype: string435 - name: document_ids436 sequence: string437 - name: scores438 sequence: float64439 - name: split440 dtype: string441 splits:442 - name: train443 num_bytes: 54401956444 num_examples: 11704445 download_size: 21520690446 dataset_size: 54401956447- config_name: scores_javascript448 features:449 - name: query_id450 dtype: string451 - name: document_ids452 sequence: string453 - name: scores454 sequence: float64455 - name: split456 dtype: string457 splits:458 - name: train459 num_bytes: 302869960460 num_examples: 50396461 download_size: 105184511462 dataset_size: 302869960463- config_name: scores_php464 features:465 - name: query_id466 dtype: string467 - name: document_ids468 sequence: string469 - name: scores470 sequence: float64471 - name: split472 dtype: string473 splits:474 - name: train475 num_bytes: 81851190476 num_examples: 18139477 download_size: 34431774478 dataset_size: 81851190479- config_name: scores_python480 features:481 - name: query_id482 dtype: string483 - name: document_ids484 sequence: string485 - name: scores486 sequence: float64487 - name: split488 dtype: string489 splits:490 - name: train491 num_bytes: 211457905492 num_examples: 40751493 download_size: 82914920494 dataset_size: 211457905495- config_name: scores_ruby496 features:497 - name: query_id498 dtype: string499 - name: document_ids500 sequence: string501 - name: scores502 sequence: float64503 - name: split504 dtype: string505 splits:506 - name: train507 num_bytes: 289961877508 num_examples: 60376509 download_size: 127433631510 dataset_size: 289961877511- config_name: scores_rust512 features:513 - name: query_id514 dtype: string515 - name: document_ids516 sequence: string517 - name: scores518 sequence: float64519 - name: split520 dtype: string521 splits:522 - name: train523 num_bytes: 2811980524 num_examples: 640525 download_size: 1153248526 dataset_size: 2811980527- config_name: scores_scala528 features:529 - name: query_id530 dtype: string531 - name: document_ids532 sequence: string533 - name: scores534 sequence: float64535 - name: split536 dtype: string537 splits:538 - name: train539 num_bytes: 13135260540 num_examples: 2767541 download_size: 4902366542 dataset_size: 13135260543- config_name: scores_swift544 features:545 - name: query_id546 dtype: string547 - name: document_ids548 sequence: string549 - name: scores550 sequence: float64551 - name: split552 dtype: string553 splits:554 - name: train555 num_bytes: 10469310556 num_examples: 2210557 download_size: 3910978558 dataset_size: 10469310559- config_name: scores_typescript560 features:561 - name: query_id562 dtype: string563 - name: document_ids564 sequence: string565 - name: scores566 sequence: float64567 - name: split568 dtype: string569 splits:570 - name: train571 num_bytes: 20829430572 num_examples: 3600573 download_size: 6418594574 dataset_size: 20829430575configs:576- config_name: documents_bash577 data_files:578 - split: train579 path: documents_bash/train-*580- config_name: documents_c581 data_files:582 - split: train583 path: documents_c/train-*584- config_name: documents_c++585 data_files:586 - split: train587 path: documents_c++/train-*588- config_name: documents_go589 data_files:590 - split: train591 path: documents_go/train-*592- config_name: documents_java593 data_files:594 - split: train595 path: documents_java/train-*596- config_name: documents_javascript597 data_files:598 - split: train599 path: documents_javascript/train-*600- config_name: documents_php601 data_files:602 - split: train603 path: documents_php/train-*604- config_name: documents_python605 data_files:606 - split: train607 path: documents_python/train-*608- config_name: documents_ruby609 data_files:610 - split: train611 path: documents_ruby/train-*612- config_name: documents_rust613 data_files:614 - split: train615 path: documents_rust/train-*616- config_name: documents_scala617 data_files:618 - split: train619 path: documents_scala/train-*620- config_name: documents_swift621 data_files:622 - split: train623 path: documents_swift/train-*624- config_name: documents_typescript625 data_files:626 - split: train627 path: documents_typescript/train-*628- config_name: queries_bash629 data_files:630 - split: train631 path: queries_bash/train-*632- config_name: queries_c633 data_files:634 - split: train635 path: queries_c/train-*636- config_name: queries_c++637 data_files:638 - split: train639 path: queries_c++/train-*640- config_name: queries_go641 data_files:642 - split: train643 path: queries_go/train-*644- config_name: queries_java645 data_files:646 - split: train647 path: queries_java/train-*648- config_name: queries_javascript649 data_files:650 - split: train651 path: queries_javascript/train-*652- config_name: queries_php653 data_files:654 - split: train655 path: queries_php/train-*656- config_name: queries_python657 data_files:658 - split: train659 path: queries_python/train-*660- config_name: queries_ruby661 data_files:662 - split: train663 path: queries_ruby/train-*664- config_name: queries_rust665 data_files:666 - split: train667 path: queries_rust/train-*668- config_name: queries_scala669 data_files:670 - split: train671 path: queries_scala/train-*672- config_name: queries_swift673 data_files:674 - split: train675 path: queries_swift/train-*676- config_name: queries_typescript677 data_files:678 - split: train679 path: queries_typescript/train-*680- config_name: scores_bash681 data_files:682 - split: train683 path: scores_bash/train-*684- config_name: scores_c685 data_files:686 - split: train687 path: scores_c/train-*688- config_name: scores_c++689 data_files:690 - split: train691 path: scores_c++/train-*692- config_name: scores_go693 data_files:694 - split: train695 path: scores_go/train-*696- config_name: scores_java697 data_files:698 - split: train699 path: scores_java/train-*700- config_name: scores_javascript701 data_files:702 - split: train703 path: scores_javascript/train-*704- config_name: scores_php705 data_files:706 - split: train707 path: scores_php/train-*708- config_name: scores_python709 data_files:710 - split: train711 path: scores_python/train-*712- config_name: scores_ruby713 data_files:714 - split: train715 path: scores_ruby/train-*716- config_name: scores_rust717 data_files:718 - split: train719 path: scores_rust/train-*720- config_name: scores_scala721 data_files:722 - split: train723 path: scores_scala/train-*724- config_name: scores_swift725 data_files:726 - split: train727 path: scores_swift/train-*728- config_name: scores_typescript729 data_files:730 - split: train731 path: scores_typescript/train-*732---733 