CoolFace
Datasetpublic

CoIR-Retrieval/CodeSearchNet

Employing the MTEB evaluation framework's dataset version, utilize the code below for assessment: import mteb import logging from sentence_transformers import SentenceTransformer from mteb import MTEB logger = logging.getLogger(__name__) model_name = 'intfloat/e5-base-v2' model = SentenceTransformer(model_name) tasks = mteb.get_tasks( tasks=[ "AppsRetrieval", "CodeFeedbackMT", "CodeFeedbackST", "CodeTransOceanContest", "CodeTransOceanDL"… See the full description on the dataset page: https://huggingface.co/datasets/CoIR-Retrieval/CodeSearchNet.

sourceHugging Faceupdated 2y agoView on Hugging Face
3likes2.8kdownloads
README.md517 linesDownload Raw Back to root
1---2dataset_info:3- config_name: go-corpus4  features:5  - name: _id6    dtype: string7  - name: title8    dtype: string9  - name: partition10    dtype: string11  - name: text12    dtype: string13  - name: language14    dtype: string15  - name: meta_information16    struct:17    - name: resource18      dtype: string19  splits:20  - name: corpus21    num_bytes: 2421919122    num_examples: 18244023  download_size: 995694524  dataset_size: 2421919125- config_name: go-qrels26  features:27  - name: query-id28    dtype: string29  - name: corpus-id30    dtype: string31  - name: score32    dtype: int6433  splits:34  - name: train35    num_bytes: 479642036    num_examples: 16728837  - name: valid38    num_bytes: 21961939    num_examples: 732540  - name: test41    num_bytes: 24358042    num_examples: 812243  download_size: 208028344  dataset_size: 525961945- config_name: go-queries46  features:47  - name: _id48    dtype: string49  - name: title50    dtype: string51  - name: partition52    dtype: string53  - name: text54    dtype: string55  - name: language56    dtype: string57  - name: meta_information58    struct:59    - name: resource60      dtype: string61  splits:62  - name: queries63    num_bytes: 8393611164    num_examples: 18273565  download_size: 3437857666  dataset_size: 8393611167- config_name: java-corpus68  features:69  - name: _id70    dtype: string71  - name: title72    dtype: string73  - name: partition74    dtype: string75  - name: text76    dtype: string77  - name: language78    dtype: string79  - name: meta_information80    struct:81    - name: resource82      dtype: string83  splits:84  - name: corpus85    num_bytes: 3837145586    num_examples: 18086687  download_size: 1523408788  dataset_size: 3837145589- config_name: java-qrels90  features:91  - name: query-id92    dtype: string93  - name: corpus-id94    dtype: string95  - name: score96    dtype: int6497  splits:98  - name: train99    num_bytes: 4725470100    num_examples: 164923101  - name: valid102    num_bytes: 155446103    num_examples: 5183104  - name: test105    num_bytes: 328570106    num_examples: 10955107  download_size: 2059856108  dataset_size: 5209486109- config_name: java-queries110  features:111  - name: _id112    dtype: string113  - name: title114    dtype: string115  - name: partition116    dtype: string117  - name: text118    dtype: string119  - name: language120    dtype: string121  - name: meta_information122    struct:123    - name: resource124      dtype: string125  splits:126  - name: queries127    num_bytes: 122471943128    num_examples: 181061129  download_size: 44431907130  dataset_size: 122471943131- config_name: javascript-corpus132  features:133  - name: _id134    dtype: string135  - name: title136    dtype: string137  - name: partition138    dtype: string139  - name: text140    dtype: string141  - name: language142    dtype: string143  - name: meta_information144    struct:145    - name: resource146      dtype: string147  splits:148  - name: corpus149    num_bytes: 13615813150    num_examples: 64854151  download_size: 6024499152  dataset_size: 13615813153- config_name: javascript-qrels154  features:155  - name: query-id156    dtype: string157  - name: corpus-id158    dtype: string159  - name: score160    dtype: int64161  splits:162  - name: train163    num_bytes: 1602480164    num_examples: 58025165  - name: valid166    num_bytes: 108764167    num_examples: 3885168  - name: test169    num_bytes: 92079170    num_examples: 3291171  download_size: 743915172  dataset_size: 1803323173- config_name: javascript-queries174  features:175  - name: _id176    dtype: string177  - name: title178    dtype: string179  - name: partition180    dtype: string181  - name: text182    dtype: string183  - name: language184    dtype: string185  - name: meta_information186    struct:187    - name: resource188      dtype: string189  splits:190  - name: queries191    num_bytes: 45694515192    num_examples: 65201193  download_size: 18551106194  dataset_size: 45694515195- config_name: php-corpus196  features:197  - name: _id198    dtype: string199  - name: title200    dtype: string201  - name: partition202    dtype: string203  - name: text204    dtype: string205  - name: language206    dtype: string207  - name: meta_information208    struct:209    - name: resource210      dtype: string211  splits:212  - name: corpus213    num_bytes: 53006567214    num_examples: 267725215  download_size: 21441456216  dataset_size: 53006567217- config_name: php-qrels218  features:219  - name: query-id220    dtype: string221  - name: corpus-id222    dtype: string223  - name: score224    dtype: int64225  splits:226  - name: train227    num_bytes: 7015010228    num_examples: 241241229  - name: valid230    num_bytes: 389351231    num_examples: 12982232  - name: test233    num_bytes: 420329234    num_examples: 14014235  download_size: 3053625236  dataset_size: 7824690237- config_name: php-queries238  features:239  - name: _id240    dtype: string241  - name: title242    dtype: string243  - name: partition244    dtype: string245  - name: text246    dtype: string247  - name: language248    dtype: string249  - name: meta_information250    struct:251    - name: resource252      dtype: string253  splits:254  - name: queries255    num_bytes: 173998597256    num_examples: 268237257  download_size: 62676806258  dataset_size: 173998597259- config_name: python-corpus260  features:261  - name: _id262    dtype: string263  - name: title264    dtype: string265  - name: partition266    dtype: string267  - name: text268    dtype: string269  - name: language270    dtype: string271  - name: meta_information272    struct:273    - name: resource274      dtype: string275  splits:276  - name: corpus277    num_bytes: 82647410278    num_examples: 280310279  download_size: 33103044280  dataset_size: 82647410281- config_name: python-qrels282  features:283  - name: query-id284    dtype: string285  - name: corpus-id286    dtype: string287  - name: score288    dtype: int64289  splits:290  - name: train291    num_bytes: 7332380292    num_examples: 251820293  - name: valid294    num_bytes: 417349295    num_examples: 13914296  - name: test297    num_bytes: 447448298    num_examples: 14918299  download_size: 3194200300  dataset_size: 8197177301- config_name: python-queries302  features:303  - name: _id304    dtype: string305  - name: title306    dtype: string307  - name: partition308    dtype: string309  - name: text310    dtype: string311  - name: language312    dtype: string313  - name: meta_information314    struct:315    - name: resource316      dtype: string317  splits:318  - name: queries319    num_bytes: 267462526320    num_examples: 280652321  download_size: 105273567322  dataset_size: 267462526323- config_name: ruby-corpus324  features:325  - name: _id326    dtype: string327  - name: title328    dtype: string329  - name: partition330    dtype: string331  - name: text332    dtype: string333  - name: language334    dtype: string335  - name: meta_information336    struct:337    - name: resource338      dtype: string339  splits:340  - name: corpus341    num_bytes: 7285353342    num_examples: 27570343  download_size: 3144098344  dataset_size: 7285353345- config_name: ruby-qrels346  features:347  - name: query-id348    dtype: string349  - name: corpus-id350    dtype: string351  - name: score352    dtype: int64353  splits:354  - name: train355    num_bytes: 675736356    num_examples: 24927357  - name: valid358    num_bytes: 39196359    num_examples: 1400360  - name: test361    num_bytes: 35302362    num_examples: 1261363  download_size: 316865364  dataset_size: 750234365- config_name: ruby-queries366  features:367  - name: _id368    dtype: string369  - name: title370    dtype: string371  - name: partition372    dtype: string373  - name: text374    dtype: string375  - name: language376    dtype: string377  - name: meta_information378    struct:379    - name: resource380      dtype: string381  splits:382  - name: queries383    num_bytes: 13895860384    num_examples: 27588385  download_size: 5834046386  dataset_size: 13895860387configs:388- config_name: go-corpus389  data_files:390  - split: corpus391    path: go-corpus/corpus-*392- config_name: go-qrels393  data_files:394  - split: train395    path: go-qrels/train-*396  - split: valid397    path: go-qrels/valid-*398  - split: test399    path: go-qrels/test-*400- config_name: go-queries401  data_files:402  - split: queries403    path: go-queries/queries-*404- config_name: java-corpus405  data_files:406  - split: corpus407    path: java-corpus/corpus-*408- config_name: java-qrels409  data_files:410  - split: train411    path: java-qrels/train-*412  - split: valid413    path: java-qrels/valid-*414  - split: test415    path: java-qrels/test-*416- config_name: java-queries417  data_files:418  - split: queries419    path: java-queries/queries-*420- config_name: javascript-corpus421  data_files:422  - split: corpus423    path: javascript-corpus/corpus-*424- config_name: javascript-qrels425  data_files:426  - split: train427    path: javascript-qrels/train-*428  - split: valid429    path: javascript-qrels/valid-*430  - split: test431    path: javascript-qrels/test-*432- config_name: javascript-queries433  data_files:434  - split: queries435    path: javascript-queries/queries-*436- config_name: php-corpus437  data_files:438  - split: corpus439    path: php-corpus/corpus-*440- config_name: php-qrels441  data_files:442  - split: train443    path: php-qrels/train-*444  - split: valid445    path: php-qrels/valid-*446  - split: test447    path: php-qrels/test-*448- config_name: php-queries449  data_files:450  - split: queries451    path: php-queries/queries-*452- config_name: python-corpus453  data_files:454  - split: corpus455    path: python-corpus/corpus-*456- config_name: python-qrels457  data_files:458  - split: train459    path: python-qrels/train-*460  - split: valid461    path: python-qrels/valid-*462  - split: test463    path: python-qrels/test-*464- config_name: python-queries465  data_files:466  - split: queries467    path: python-queries/queries-*468- config_name: ruby-corpus469  data_files:470  - split: corpus471    path: ruby-corpus/corpus-*472- config_name: ruby-qrels473  data_files:474  - split: train475    path: ruby-qrels/train-*476  - split: valid477    path: ruby-qrels/valid-*478  - split: test479    path: ruby-qrels/test-*480- config_name: ruby-queries481  data_files:482  - split: queries483    path: ruby-queries/queries-*484---485Employing the MTEB evaluation framework's dataset version, utilize the code below for assessment:486 487```python488import mteb489import logging490from sentence_transformers import SentenceTransformer491from mteb import MTEB492 493logger = logging.getLogger(__name__)494 495model_name = 'intfloat/e5-base-v2'496model = SentenceTransformer(model_name)497tasks = mteb.get_tasks(498    tasks=[499        "AppsRetrieval",500        "CodeFeedbackMT",501        "CodeFeedbackST",502        "CodeTransOceanContest",503        "CodeTransOceanDL",504        "CosQA",505        "SyntheticText2SQL",506        "StackOverflowQA",507        "COIRCodeSearchNetRetrieval",508        "CodeSearchNetCCRetrieval",509    ]510)511evaluation = MTEB(tasks=tasks)512results = evaluation.run(513    model=model,514    overwrite_results=True515)516print(result)517```