CoolFace
Datasetpublic

Shuu12121/codeedit_hard_negative_datasets_kd

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes564downloads
README.md733 linesDownload Raw Back to root
1---2dataset_info:3- config_name: documents_bash4  features:5  - name: document_id6    dtype: string7  - name: document8    dtype: string9  - name: split10    dtype: string11  splits:12  - name: train13    num_bytes: 1086316214    num_examples: 2439115  download_size: 553588416  dataset_size: 1086316217- config_name: documents_c18  features:19  - name: document_id20    dtype: string21  - name: document22    dtype: string23  - name: split24    dtype: string25  splits:26  - name: train27    num_bytes: 220887328    num_examples: 516229  download_size: 110050530  dataset_size: 220887331- config_name: documents_c++32  features:33  - name: document_id34    dtype: string35  - name: document36    dtype: string37  - name: split38    dtype: string39  splits:40  - name: train41    num_bytes: 99840442    num_examples: 204043  download_size: 49041644  dataset_size: 99840445- config_name: documents_go46  features:47  - name: document_id48    dtype: string49  - name: document50    dtype: string51  - name: split52    dtype: string53  splits:54  - name: train55    num_bytes: 164536656    num_examples: 321457  download_size: 83425058  dataset_size: 164536659- config_name: documents_java60  features:61  - name: document_id62    dtype: string63  - name: document64    dtype: string65  - name: split66    dtype: string67  splits:68  - name: train69    num_bytes: 783010370    num_examples: 1170471  download_size: 343913772  dataset_size: 783010373- config_name: documents_javascript74  features:75  - name: document_id76    dtype: string77  - name: document78    dtype: string79  - name: split80    dtype: string81  splits:82  - name: train83    num_bytes: 3013338584    num_examples: 5039685  download_size: 1400201686  dataset_size: 3013338587- config_name: documents_php88  features:89  - name: document_id90    dtype: string91  - name: document92    dtype: string93  - name: split94    dtype: string95  splits:96  - name: train97    num_bytes: 1030698398    num_examples: 1813999  download_size: 4615471100  dataset_size: 10306983101- config_name: documents_python102  features:103  - name: document_id104    dtype: string105  - name: document106    dtype: string107  - name: split108    dtype: string109  splits:110  - name: train111    num_bytes: 23878238112    num_examples: 40751113  download_size: 11354715114  dataset_size: 23878238115- config_name: documents_ruby116  features:117  - name: document_id118    dtype: string119  - name: document120    dtype: string121  - name: split122    dtype: string123  splits:124  - name: train125    num_bytes: 30762063126    num_examples: 60376127  download_size: 14814665128  dataset_size: 30762063129- config_name: documents_rust130  features:131  - name: document_id132    dtype: string133  - name: document134    dtype: string135  - name: split136    dtype: string137  splits:138  - name: train139    num_bytes: 317861140    num_examples: 640141  download_size: 146149142  dataset_size: 317861143- config_name: documents_scala144  features:145  - name: document_id146    dtype: string147  - name: document148    dtype: string149  - name: split150    dtype: string151  splits:152  - name: train153    num_bytes: 1342487154    num_examples: 2767155  download_size: 593337156  dataset_size: 1342487157- config_name: documents_swift158  features:159  - name: document_id160    dtype: string161  - name: document162    dtype: string163  - name: split164    dtype: string165  splits:166  - name: train167    num_bytes: 1386085168    num_examples: 2210169  download_size: 592016170  dataset_size: 1386085171- config_name: documents_typescript172  features:173  - name: document_id174    dtype: string175  - name: document176    dtype: string177  - name: split178    dtype: string179  splits:180  - name: train181    num_bytes: 2262888182    num_examples: 3600183  download_size: 1014513184  dataset_size: 2262888185- config_name: queries_bash186  features:187  - name: query_id188    dtype: string189  - name: query190    dtype: string191  - name: split192    dtype: string193  splits:194  - name: train195    num_bytes: 2392708196    num_examples: 24391197  download_size: 1421894198  dataset_size: 2392708199- config_name: queries_c200  features:201  - name: query_id202    dtype: string203  - name: query204    dtype: string205  - name: split206    dtype: string207  splits:208  - name: train209    num_bytes: 654403210    num_examples: 5162211  download_size: 396287212  dataset_size: 654403213- config_name: queries_c++214  features:215  - name: query_id216    dtype: string217  - name: query218    dtype: string219  - name: split220    dtype: string221  splits:222  - name: train223    num_bytes: 266127224    num_examples: 2040225  download_size: 148458226  dataset_size: 266127227- config_name: queries_go228  features:229  - name: query_id230    dtype: string231  - name: query232    dtype: string233  - name: split234    dtype: string235  splits:236  - name: train237    num_bytes: 311061238    num_examples: 3214239  download_size: 190929240  dataset_size: 311061241- config_name: queries_java242  features:243  - name: query_id244    dtype: string245  - name: query246    dtype: string247  - name: split248    dtype: string249  splits:250  - name: train251    num_bytes: 1117782252    num_examples: 11704253  download_size: 659705254  dataset_size: 1117782255- config_name: queries_javascript256  features:257  - name: query_id258    dtype: string259  - name: query260    dtype: string261  - name: split262    dtype: string263  splits:264  - name: train265    num_bytes: 5018002266    num_examples: 50396267  download_size: 2493657268  dataset_size: 5018002269- config_name: queries_php270  features:271  - name: query_id272    dtype: string273  - name: query274    dtype: string275  - name: split276    dtype: string277  splits:278  - name: train279    num_bytes: 1584483280    num_examples: 18139281  download_size: 901849282  dataset_size: 1584483283- config_name: queries_python284  features:285  - name: query_id286    dtype: string287  - name: query288    dtype: string289  - name: split290    dtype: string291  splits:292  - name: train293    num_bytes: 4009877294    num_examples: 40751295  download_size: 2227568296  dataset_size: 4009877297- config_name: queries_ruby298  features:299  - name: query_id300    dtype: string301  - name: query302    dtype: string303  - name: split304    dtype: string305  splits:306  - name: train307    num_bytes: 5929906308    num_examples: 60376309  download_size: 3392931310  dataset_size: 5929906311- config_name: queries_rust312  features:313  - name: query_id314    dtype: string315  - name: query316    dtype: string317  - name: split318    dtype: string319  splits:320  - name: train321    num_bytes: 59896322    num_examples: 640323  download_size: 35323324  dataset_size: 59896325- config_name: queries_scala326  features:327  - name: query_id328    dtype: string329  - name: query330    dtype: string331  - name: split332    dtype: string333  splits:334  - name: train335    num_bytes: 249919336    num_examples: 2767337  download_size: 122113338  dataset_size: 249919339- config_name: queries_swift340  features:341  - name: query_id342    dtype: string343  - name: query344    dtype: string345  - name: split346    dtype: string347  splits:348  - name: train349    num_bytes: 195921350    num_examples: 2210351  download_size: 108253352  dataset_size: 195921353- config_name: queries_typescript354  features:355  - name: query_id356    dtype: string357  - name: query358    dtype: string359  - name: split360    dtype: string361  splits:362  - name: train363    num_bytes: 344261364    num_examples: 3600365  download_size: 170931366  dataset_size: 344261367- config_name: scores_bash368  features:369  - name: query_id370    dtype: string371  - name: document_ids372    sequence: string373  - name: scores374    sequence: float64375  - name: split376    dtype: string377  splits:378  - name: train379    num_bytes: 115763077380    num_examples: 24391381  download_size: 46930974382  dataset_size: 115763077383- config_name: scores_c384  features:385  - name: query_id386    dtype: string387  - name: document_ids388    sequence: string389  - name: scores390    sequence: float64391  - name: split392    dtype: string393  splits:394  - name: train395    num_bytes: 20563111396    num_examples: 5162397  download_size: 9177093398  dataset_size: 20563111399- config_name: scores_c++400  features:401  - name: query_id402    dtype: string403  - name: document_ids404    sequence: string405  - name: scores406    sequence: float64407  - name: split408    dtype: string409  splits:410  - name: train411    num_bytes: 8816269412    num_examples: 2040413  download_size: 3479821414  dataset_size: 8816269415- config_name: scores_go416  features:417  - name: query_id418    dtype: string419  - name: document_ids420    sequence: string421  - name: scores422    sequence: float64423  - name: split424    dtype: string425  splits:426  - name: train427    num_bytes: 13341589428    num_examples: 3214429  download_size: 5678148430  dataset_size: 13341589431- config_name: scores_java432  features:433  - name: query_id434    dtype: string435  - name: document_ids436    sequence: string437  - name: scores438    sequence: float64439  - name: split440    dtype: string441  splits:442  - name: train443    num_bytes: 54401956444    num_examples: 11704445  download_size: 21520690446  dataset_size: 54401956447- config_name: scores_javascript448  features:449  - name: query_id450    dtype: string451  - name: document_ids452    sequence: string453  - name: scores454    sequence: float64455  - name: split456    dtype: string457  splits:458  - name: train459    num_bytes: 302869960460    num_examples: 50396461  download_size: 105184511462  dataset_size: 302869960463- config_name: scores_php464  features:465  - name: query_id466    dtype: string467  - name: document_ids468    sequence: string469  - name: scores470    sequence: float64471  - name: split472    dtype: string473  splits:474  - name: train475    num_bytes: 81851190476    num_examples: 18139477  download_size: 34431774478  dataset_size: 81851190479- config_name: scores_python480  features:481  - name: query_id482    dtype: string483  - name: document_ids484    sequence: string485  - name: scores486    sequence: float64487  - name: split488    dtype: string489  splits:490  - name: train491    num_bytes: 211457905492    num_examples: 40751493  download_size: 82914920494  dataset_size: 211457905495- config_name: scores_ruby496  features:497  - name: query_id498    dtype: string499  - name: document_ids500    sequence: string501  - name: scores502    sequence: float64503  - name: split504    dtype: string505  splits:506  - name: train507    num_bytes: 289961877508    num_examples: 60376509  download_size: 127433631510  dataset_size: 289961877511- config_name: scores_rust512  features:513  - name: query_id514    dtype: string515  - name: document_ids516    sequence: string517  - name: scores518    sequence: float64519  - name: split520    dtype: string521  splits:522  - name: train523    num_bytes: 2811980524    num_examples: 640525  download_size: 1153248526  dataset_size: 2811980527- config_name: scores_scala528  features:529  - name: query_id530    dtype: string531  - name: document_ids532    sequence: string533  - name: scores534    sequence: float64535  - name: split536    dtype: string537  splits:538  - name: train539    num_bytes: 13135260540    num_examples: 2767541  download_size: 4902366542  dataset_size: 13135260543- config_name: scores_swift544  features:545  - name: query_id546    dtype: string547  - name: document_ids548    sequence: string549  - name: scores550    sequence: float64551  - name: split552    dtype: string553  splits:554  - name: train555    num_bytes: 10469310556    num_examples: 2210557  download_size: 3910978558  dataset_size: 10469310559- config_name: scores_typescript560  features:561  - name: query_id562    dtype: string563  - name: document_ids564    sequence: string565  - name: scores566    sequence: float64567  - name: split568    dtype: string569  splits:570  - name: train571    num_bytes: 20829430572    num_examples: 3600573  download_size: 6418594574  dataset_size: 20829430575configs:576- config_name: documents_bash577  data_files:578  - split: train579    path: documents_bash/train-*580- config_name: documents_c581  data_files:582  - split: train583    path: documents_c/train-*584- config_name: documents_c++585  data_files:586  - split: train587    path: documents_c++/train-*588- config_name: documents_go589  data_files:590  - split: train591    path: documents_go/train-*592- config_name: documents_java593  data_files:594  - split: train595    path: documents_java/train-*596- config_name: documents_javascript597  data_files:598  - split: train599    path: documents_javascript/train-*600- config_name: documents_php601  data_files:602  - split: train603    path: documents_php/train-*604- config_name: documents_python605  data_files:606  - split: train607    path: documents_python/train-*608- config_name: documents_ruby609  data_files:610  - split: train611    path: documents_ruby/train-*612- config_name: documents_rust613  data_files:614  - split: train615    path: documents_rust/train-*616- config_name: documents_scala617  data_files:618  - split: train619    path: documents_scala/train-*620- config_name: documents_swift621  data_files:622  - split: train623    path: documents_swift/train-*624- config_name: documents_typescript625  data_files:626  - split: train627    path: documents_typescript/train-*628- config_name: queries_bash629  data_files:630  - split: train631    path: queries_bash/train-*632- config_name: queries_c633  data_files:634  - split: train635    path: queries_c/train-*636- config_name: queries_c++637  data_files:638  - split: train639    path: queries_c++/train-*640- config_name: queries_go641  data_files:642  - split: train643    path: queries_go/train-*644- config_name: queries_java645  data_files:646  - split: train647    path: queries_java/train-*648- config_name: queries_javascript649  data_files:650  - split: train651    path: queries_javascript/train-*652- config_name: queries_php653  data_files:654  - split: train655    path: queries_php/train-*656- config_name: queries_python657  data_files:658  - split: train659    path: queries_python/train-*660- config_name: queries_ruby661  data_files:662  - split: train663    path: queries_ruby/train-*664- config_name: queries_rust665  data_files:666  - split: train667    path: queries_rust/train-*668- config_name: queries_scala669  data_files:670  - split: train671    path: queries_scala/train-*672- config_name: queries_swift673  data_files:674  - split: train675    path: queries_swift/train-*676- config_name: queries_typescript677  data_files:678  - split: train679    path: queries_typescript/train-*680- config_name: scores_bash681  data_files:682  - split: train683    path: scores_bash/train-*684- config_name: scores_c685  data_files:686  - split: train687    path: scores_c/train-*688- config_name: scores_c++689  data_files:690  - split: train691    path: scores_c++/train-*692- config_name: scores_go693  data_files:694  - split: train695    path: scores_go/train-*696- config_name: scores_java697  data_files:698  - split: train699    path: scores_java/train-*700- config_name: scores_javascript701  data_files:702  - split: train703    path: scores_javascript/train-*704- config_name: scores_php705  data_files:706  - split: train707    path: scores_php/train-*708- config_name: scores_python709  data_files:710  - split: train711    path: scores_python/train-*712- config_name: scores_ruby713  data_files:714  - split: train715    path: scores_ruby/train-*716- config_name: scores_rust717  data_files:718  - split: train719    path: scores_rust/train-*720- config_name: scores_scala721  data_files:722  - split: train723    path: scores_scala/train-*724- config_name: scores_swift725  data_files:726  - split: train727    path: scores_swift/train-*728- config_name: scores_typescript729  data_files:730  - split: train731    path: scores_typescript/train-*732---733