CoIR-Retrieval/CodeSearchNet
Employing the MTEB evaluation framework's dataset version, utilize the code below for assessment: import mteb import logging from sentence_transformers import SentenceTransformer from mteb import MTEB logger = logging.getLogger(__name__) model_name = 'intfloat/e5-base-v2' model = SentenceTransformer(model_name) tasks = mteb.get_tasks( tasks=[ "AppsRetrieval", "CodeFeedbackMT", "CodeFeedbackST", "CodeTransOceanContest", "CodeTransOceanDL"… See the full description on the dataset page: https://huggingface.co/datasets/CoIR-Retrieval/CodeSearchNet.
32.8k
1---2dataset_info:3- config_name: go-corpus4 features:5 - name: _id6 dtype: string7 - name: title8 dtype: string9 - name: partition10 dtype: string11 - name: text12 dtype: string13 - name: language14 dtype: string15 - name: meta_information16 struct:17 - name: resource18 dtype: string19 splits:20 - name: corpus21 num_bytes: 2421919122 num_examples: 18244023 download_size: 995694524 dataset_size: 2421919125- config_name: go-qrels26 features:27 - name: query-id28 dtype: string29 - name: corpus-id30 dtype: string31 - name: score32 dtype: int6433 splits:34 - name: train35 num_bytes: 479642036 num_examples: 16728837 - name: valid38 num_bytes: 21961939 num_examples: 732540 - name: test41 num_bytes: 24358042 num_examples: 812243 download_size: 208028344 dataset_size: 525961945- config_name: go-queries46 features:47 - name: _id48 dtype: string49 - name: title50 dtype: string51 - name: partition52 dtype: string53 - name: text54 dtype: string55 - name: language56 dtype: string57 - name: meta_information58 struct:59 - name: resource60 dtype: string61 splits:62 - name: queries63 num_bytes: 8393611164 num_examples: 18273565 download_size: 3437857666 dataset_size: 8393611167- config_name: java-corpus68 features:69 - name: _id70 dtype: string71 - name: title72 dtype: string73 - name: partition74 dtype: string75 - name: text76 dtype: string77 - name: language78 dtype: string79 - name: meta_information80 struct:81 - name: resource82 dtype: string83 splits:84 - name: corpus85 num_bytes: 3837145586 num_examples: 18086687 download_size: 1523408788 dataset_size: 3837145589- config_name: java-qrels90 features:91 - name: query-id92 dtype: string93 - name: corpus-id94 dtype: string95 - name: score96 dtype: int6497 splits:98 - name: train99 num_bytes: 4725470100 num_examples: 164923101 - name: valid102 num_bytes: 155446103 num_examples: 5183104 - name: test105 num_bytes: 328570106 num_examples: 10955107 download_size: 2059856108 dataset_size: 5209486109- config_name: java-queries110 features:111 - name: _id112 dtype: string113 - name: title114 dtype: string115 - name: partition116 dtype: string117 - name: text118 dtype: string119 - name: language120 dtype: string121 - name: meta_information122 struct:123 - name: resource124 dtype: string125 splits:126 - name: queries127 num_bytes: 122471943128 num_examples: 181061129 download_size: 44431907130 dataset_size: 122471943131- config_name: javascript-corpus132 features:133 - name: _id134 dtype: string135 - name: title136 dtype: string137 - name: partition138 dtype: string139 - name: text140 dtype: string141 - name: language142 dtype: string143 - name: meta_information144 struct:145 - name: resource146 dtype: string147 splits:148 - name: corpus149 num_bytes: 13615813150 num_examples: 64854151 download_size: 6024499152 dataset_size: 13615813153- config_name: javascript-qrels154 features:155 - name: query-id156 dtype: string157 - name: corpus-id158 dtype: string159 - name: score160 dtype: int64161 splits:162 - name: train163 num_bytes: 1602480164 num_examples: 58025165 - name: valid166 num_bytes: 108764167 num_examples: 3885168 - name: test169 num_bytes: 92079170 num_examples: 3291171 download_size: 743915172 dataset_size: 1803323173- config_name: javascript-queries174 features:175 - name: _id176 dtype: string177 - name: title178 dtype: string179 - name: partition180 dtype: string181 - name: text182 dtype: string183 - name: language184 dtype: string185 - name: meta_information186 struct:187 - name: resource188 dtype: string189 splits:190 - name: queries191 num_bytes: 45694515192 num_examples: 65201193 download_size: 18551106194 dataset_size: 45694515195- config_name: php-corpus196 features:197 - name: _id198 dtype: string199 - name: title200 dtype: string201 - name: partition202 dtype: string203 - name: text204 dtype: string205 - name: language206 dtype: string207 - name: meta_information208 struct:209 - name: resource210 dtype: string211 splits:212 - name: corpus213 num_bytes: 53006567214 num_examples: 267725215 download_size: 21441456216 dataset_size: 53006567217- config_name: php-qrels218 features:219 - name: query-id220 dtype: string221 - name: corpus-id222 dtype: string223 - name: score224 dtype: int64225 splits:226 - name: train227 num_bytes: 7015010228 num_examples: 241241229 - name: valid230 num_bytes: 389351231 num_examples: 12982232 - name: test233 num_bytes: 420329234 num_examples: 14014235 download_size: 3053625236 dataset_size: 7824690237- config_name: php-queries238 features:239 - name: _id240 dtype: string241 - name: title242 dtype: string243 - name: partition244 dtype: string245 - name: text246 dtype: string247 - name: language248 dtype: string249 - name: meta_information250 struct:251 - name: resource252 dtype: string253 splits:254 - name: queries255 num_bytes: 173998597256 num_examples: 268237257 download_size: 62676806258 dataset_size: 173998597259- config_name: python-corpus260 features:261 - name: _id262 dtype: string263 - name: title264 dtype: string265 - name: partition266 dtype: string267 - name: text268 dtype: string269 - name: language270 dtype: string271 - name: meta_information272 struct:273 - name: resource274 dtype: string275 splits:276 - name: corpus277 num_bytes: 82647410278 num_examples: 280310279 download_size: 33103044280 dataset_size: 82647410281- config_name: python-qrels282 features:283 - name: query-id284 dtype: string285 - name: corpus-id286 dtype: string287 - name: score288 dtype: int64289 splits:290 - name: train291 num_bytes: 7332380292 num_examples: 251820293 - name: valid294 num_bytes: 417349295 num_examples: 13914296 - name: test297 num_bytes: 447448298 num_examples: 14918299 download_size: 3194200300 dataset_size: 8197177301- config_name: python-queries302 features:303 - name: _id304 dtype: string305 - name: title306 dtype: string307 - name: partition308 dtype: string309 - name: text310 dtype: string311 - name: language312 dtype: string313 - name: meta_information314 struct:315 - name: resource316 dtype: string317 splits:318 - name: queries319 num_bytes: 267462526320 num_examples: 280652321 download_size: 105273567322 dataset_size: 267462526323- config_name: ruby-corpus324 features:325 - name: _id326 dtype: string327 - name: title328 dtype: string329 - name: partition330 dtype: string331 - name: text332 dtype: string333 - name: language334 dtype: string335 - name: meta_information336 struct:337 - name: resource338 dtype: string339 splits:340 - name: corpus341 num_bytes: 7285353342 num_examples: 27570343 download_size: 3144098344 dataset_size: 7285353345- config_name: ruby-qrels346 features:347 - name: query-id348 dtype: string349 - name: corpus-id350 dtype: string351 - name: score352 dtype: int64353 splits:354 - name: train355 num_bytes: 675736356 num_examples: 24927357 - name: valid358 num_bytes: 39196359 num_examples: 1400360 - name: test361 num_bytes: 35302362 num_examples: 1261363 download_size: 316865364 dataset_size: 750234365- config_name: ruby-queries366 features:367 - name: _id368 dtype: string369 - name: title370 dtype: string371 - name: partition372 dtype: string373 - name: text374 dtype: string375 - name: language376 dtype: string377 - name: meta_information378 struct:379 - name: resource380 dtype: string381 splits:382 - name: queries383 num_bytes: 13895860384 num_examples: 27588385 download_size: 5834046386 dataset_size: 13895860387configs:388- config_name: go-corpus389 data_files:390 - split: corpus391 path: go-corpus/corpus-*392- config_name: go-qrels393 data_files:394 - split: train395 path: go-qrels/train-*396 - split: valid397 path: go-qrels/valid-*398 - split: test399 path: go-qrels/test-*400- config_name: go-queries401 data_files:402 - split: queries403 path: go-queries/queries-*404- config_name: java-corpus405 data_files:406 - split: corpus407 path: java-corpus/corpus-*408- config_name: java-qrels409 data_files:410 - split: train411 path: java-qrels/train-*412 - split: valid413 path: java-qrels/valid-*414 - split: test415 path: java-qrels/test-*416- config_name: java-queries417 data_files:418 - split: queries419 path: java-queries/queries-*420- config_name: javascript-corpus421 data_files:422 - split: corpus423 path: javascript-corpus/corpus-*424- config_name: javascript-qrels425 data_files:426 - split: train427 path: javascript-qrels/train-*428 - split: valid429 path: javascript-qrels/valid-*430 - split: test431 path: javascript-qrels/test-*432- config_name: javascript-queries433 data_files:434 - split: queries435 path: javascript-queries/queries-*436- config_name: php-corpus437 data_files:438 - split: corpus439 path: php-corpus/corpus-*440- config_name: php-qrels441 data_files:442 - split: train443 path: php-qrels/train-*444 - split: valid445 path: php-qrels/valid-*446 - split: test447 path: php-qrels/test-*448- config_name: php-queries449 data_files:450 - split: queries451 path: php-queries/queries-*452- config_name: python-corpus453 data_files:454 - split: corpus455 path: python-corpus/corpus-*456- config_name: python-qrels457 data_files:458 - split: train459 path: python-qrels/train-*460 - split: valid461 path: python-qrels/valid-*462 - split: test463 path: python-qrels/test-*464- config_name: python-queries465 data_files:466 - split: queries467 path: python-queries/queries-*468- config_name: ruby-corpus469 data_files:470 - split: corpus471 path: ruby-corpus/corpus-*472- config_name: ruby-qrels473 data_files:474 - split: train475 path: ruby-qrels/train-*476 - split: valid477 path: ruby-qrels/valid-*478 - split: test479 path: ruby-qrels/test-*480- config_name: ruby-queries481 data_files:482 - split: queries483 path: ruby-queries/queries-*484---485Employing the MTEB evaluation framework's dataset version, utilize the code below for assessment:486 487```python488import mteb489import logging490from sentence_transformers import SentenceTransformer491from mteb import MTEB492 493logger = logging.getLogger(__name__)494 495model_name = 'intfloat/e5-base-v2'496model = SentenceTransformer(model_name)497tasks = mteb.get_tasks(498 tasks=[499 "AppsRetrieval",500 "CodeFeedbackMT",501 "CodeFeedbackST",502 "CodeTransOceanContest",503 "CodeTransOceanDL",504 "CosQA",505 "SyntheticText2SQL",506 "StackOverflowQA",507 "COIRCodeSearchNetRetrieval",508 "CodeSearchNetCCRetrieval",509 ]510)511evaluation = MTEB(tasks=tasks)512results = evaluation.run(513 model=model,514 overwrite_results=True515)516print(result)517```