CoolFace
Datasetpublic

mteb/MIRACLRetrieval

MIRACLRetrieval An MTEB dataset Massive Text Embedding Benchmark MIRACL (Multilingual Information Retrieval Across a Continuum of Languages) is a multilingual retrieval dataset that focuses on search across 18 different languages. Task category t2t Domains Encyclopaedic, Written Reference http://miracl.ai/ How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task =… See the full description on the dataset page: https://huggingface.co/datasets/mteb/MIRACLRetrieval.

sourceHugging Facecc-by-sa-4.0updated 1y agoView on Hugging Face
9likes2.9kdownloads
README.md1102 linesDownload Raw Back to root
1---2annotations_creators:3- expert-annotated4language:5- ara6- ben7- deu8- eng9- fas10- fin11- fra12- hin13- ind14- jpn15- kor16- rus17- spa18- swa19- tel20- tha21- yor22- zho23license: cc-by-sa-4.024multilinguality: multilingual25source_datasets:26- RSamoed/MIRACLRetrieval27task_categories:28- text-retrieval29task_ids: []30dataset_info:31- config_name: ar-corpus32  features:33  - name: _id34    dtype: string35  - name: text36    dtype: string37  - name: title38    dtype: string39  splits:40  - name: dev41    num_bytes: 121778217142    num_examples: 206141443  download_size: 54735994144  dataset_size: 121778217145- config_name: ar-qrels46  features:47  - name: query-id48    dtype: string49  - name: corpus-id50    dtype: string51  - name: score52    dtype: int6453  splits:54  - name: dev55    num_bytes: 83549756    num_examples: 2919757  download_size: 29757158  dataset_size: 83549759- config_name: ar-queries60  features:61  - name: _id62    dtype: string63  - name: text64    dtype: string65  splits:66  - name: dev67    num_bytes: 19206868    num_examples: 289669  download_size: 10717970  dataset_size: 19206871- config_name: bn-corpus72  features:73  - name: _id74    dtype: string75  - name: text76    dtype: string77  - name: title78    dtype: string79  splits:80  - name: dev81    num_bytes: 30927814482    num_examples: 29726583  download_size: 11104123184  dataset_size: 30927814485- config_name: bn-qrels86  features:87  - name: query-id88    dtype: string89  - name: corpus-id90    dtype: string91  - name: score92    dtype: int6493  splits:94  - name: dev95    num_bytes: 11382496    num_examples: 420697  download_size: 3964298  dataset_size: 11382499- config_name: bn-queries100  features:101  - name: _id102    dtype: string103  - name: text104    dtype: string105  splits:106  - name: dev107    num_bytes: 55939108    num_examples: 411109  download_size: 24670110  dataset_size: 55939111- config_name: de-corpus112  features:113  - name: _id114    dtype: string115  - name: text116    dtype: string117  - name: title118    dtype: string119  splits:120  - name: dev121    num_bytes: 7018142949122    num_examples: 15866222123  download_size: 4154965117124  dataset_size: 7018142949125- config_name: de-qrels126  features:127  - name: query-id128    dtype: string129  - name: corpus-id130    dtype: string131  - name: score132    dtype: int64133  splits:134  - name: dev135    num_bytes: 105647136    num_examples: 3144137  download_size: 36113138  dataset_size: 105647139- config_name: de-queries140  features:141  - name: _id142    dtype: string143  - name: text144    dtype: string145  splits:146  - name: dev147    num_bytes: 19450148    num_examples: 305149  download_size: 14370150  dataset_size: 19450151- config_name: en-corpus152  features:153  - name: _id154    dtype: string155  - name: text156    dtype: string157  - name: title158    dtype: string159  splits:160  - name: dev161    num_bytes: 13936141152162    num_examples: 32893221163  download_size: 7975250425164  dataset_size: 13936141152165- config_name: en-qrels166  features:167  - name: query-id168    dtype: string169  - name: corpus-id170    dtype: string171  - name: score172    dtype: int64173  splits:174  - name: dev175    num_bytes: 242967176    num_examples: 8350177  download_size: 90601178  dataset_size: 242967179- config_name: en-queries180  features:181  - name: _id182    dtype: string183  - name: text184    dtype: string185  splits:186  - name: dev187    num_bytes: 41576188    num_examples: 799189  download_size: 28786190  dataset_size: 41576191- config_name: es-corpus192  features:193  - name: _id194    dtype: string195  - name: text196    dtype: string197  - name: title198    dtype: string199  splits:200  - name: dev201    num_bytes: 4490445463202    num_examples: 10373953203  download_size: 2570067226204  dataset_size: 4490445463205- config_name: es-qrels206  features:207  - name: query-id208    dtype: string209  - name: corpus-id210    dtype: string211  - name: score212    dtype: int64213  splits:214  - name: dev215    num_bytes: 215688216    num_examples: 6443217  download_size: 71449218  dataset_size: 215688219- config_name: es-queries220  features:221  - name: _id222    dtype: string223  - name: text224    dtype: string225  splits:226  - name: dev227    num_bytes: 43504228    num_examples: 648229  download_size: 29334230  dataset_size: 43504231- config_name: fa-corpus232  features:233  - name: _id234    dtype: string235  - name: text236    dtype: string237  - name: title238    dtype: string239  splits:240  - name: dev241    num_bytes: 1091928603242    num_examples: 2207172243  download_size: 474255337244  dataset_size: 1091928603245- config_name: fa-qrels246  features:247  - name: query-id248    dtype: string249  - name: corpus-id250    dtype: string251  - name: score252    dtype: int64253  splits:254  - name: dev255    num_bytes: 216792256    num_examples: 6571257  download_size: 71058258  dataset_size: 216792259- config_name: fa-queries260  features:261  - name: _id262    dtype: string263  - name: text264    dtype: string265  splits:266  - name: dev267    num_bytes: 58114268    num_examples: 632269  download_size: 32519270  dataset_size: 58114271- config_name: fi-corpus272  features:273  - name: _id274    dtype: string275  - name: text276    dtype: string277  - name: title278    dtype: string279  splits:280  - name: dev281    num_bytes: 739208952282    num_examples: 1883509283  download_size: 438759882284  dataset_size: 739208952285- config_name: fi-qrels286  features:287  - name: query-id288    dtype: string289  - name: corpus-id290    dtype: string291  - name: score292    dtype: int64293  splits:294  - name: dev295    num_bytes: 334260296    num_examples: 12008297  download_size: 114931298  dataset_size: 334260299- config_name: fi-queries300  features:301  - name: _id302    dtype: string303  - name: text304    dtype: string305  splits:306  - name: dev307    num_bytes: 65738308    num_examples: 1271309  download_size: 46897310  dataset_size: 65738311- config_name: fr-corpus312  features:313  - name: _id314    dtype: string315  - name: text316    dtype: string317  - name: title318    dtype: string319  splits:320  - name: dev321    num_bytes: 5507181331322    num_examples: 14636953323  download_size: 3090791707324  dataset_size: 5507181331325- config_name: fr-qrels326  features:327  - name: query-id328    dtype: string329  - name: corpus-id330    dtype: string331  - name: score332    dtype: int64333  splits:334  - name: dev335    num_bytes: 115836336    num_examples: 3429337  download_size: 38727338  dataset_size: 115836339- config_name: fr-queries340  features:341  - name: _id342    dtype: string343  - name: text344    dtype: string345  splits:346  - name: dev347    num_bytes: 21433348    num_examples: 343349  download_size: 14680350  dataset_size: 21433351- config_name: hi-corpus352  features:353  - name: _id354    dtype: string355  - name: text356    dtype: string357  - name: title358    dtype: string359  splits:360  - name: dev361    num_bytes: 490803869362    num_examples: 506264363  download_size: 175786968364  dataset_size: 490803869365- config_name: hi-qrels366  features:367  - name: query-id368    dtype: string369  - name: corpus-id370    dtype: string371  - name: score372    dtype: int64373  splits:374  - name: dev375    num_bytes: 111217376    num_examples: 3494377  download_size: 36608378  dataset_size: 111217379- config_name: hi-queries380  features:381  - name: _id382    dtype: string383  - name: text384    dtype: string385  splits:386  - name: dev387    num_bytes: 54122388    num_examples: 350389  download_size: 25503390  dataset_size: 54122391- config_name: id-corpus392  features:393  - name: _id394    dtype: string395  - name: text396    dtype: string397  - name: title398    dtype: string399  splits:400  - name: dev401    num_bytes: 537334548402    num_examples: 1446315403  download_size: 271115071404  dataset_size: 537334548405- config_name: id-qrels406  features:407  - name: query-id408    dtype: string409  - name: corpus-id410    dtype: string411  - name: score412    dtype: int64413  splits:414  - name: dev415    num_bytes: 263958416    num_examples: 9668417  download_size: 90280418  dataset_size: 263958419- config_name: id-queries420  features:421  - name: _id422    dtype: string423  - name: text424    dtype: string425  splits:426  - name: dev427    num_bytes: 47803428    num_examples: 960429  download_size: 30473430  dataset_size: 47803431- config_name: ja-corpus432  features:433  - name: _id434    dtype: string435  - name: text436    dtype: string437  - name: title438    dtype: string439  splits:440  - name: dev441    num_bytes: 2970531665442    num_examples: 6953614443  download_size: 1667392675444  dataset_size: 2970531665445- config_name: ja-qrels446  features:447  - name: query-id448    dtype: string449  - name: corpus-id450    dtype: string451  - name: score452    dtype: int64453  splits:454  - name: dev455    num_bytes: 236068456    num_examples: 8354457  download_size: 83800458  dataset_size: 236068459- config_name: ja-queries460  features:461  - name: _id462    dtype: string463  - name: text464    dtype: string465  splits:466  - name: dev467    num_bytes: 55179468    num_examples: 860469  download_size: 33901470  dataset_size: 55179471- config_name: ko-corpus472  features:473  - name: _id474    dtype: string475  - name: text476    dtype: string477  - name: title478    dtype: string479  splits:480  - name: dev481    num_bytes: 633206834482    num_examples: 1486752483  download_size: 361325767484  dataset_size: 633206834485- config_name: ko-qrels486  features:487  - name: query-id488    dtype: string489  - name: corpus-id490    dtype: string491  - name: score492    dtype: int64493  splits:494  - name: dev495    num_bytes: 83188496    num_examples: 3057497  download_size: 30628498  dataset_size: 83188499- config_name: ko-queries500  features:501  - name: _id502    dtype: string503  - name: text504    dtype: string505  splits:506  - name: dev507    num_bytes: 13875508    num_examples: 213509  download_size: 9844510  dataset_size: 13875511- config_name: ru-corpus512  features:513  - name: _id514    dtype: string515  - name: text516    dtype: string517  - name: title518    dtype: string519  splits:520  - name: dev521    num_bytes: 5921641619522    num_examples: 9543918523  download_size: 2767862757524  dataset_size: 5921641619525- config_name: ru-qrels526  features:527  - name: query-id528    dtype: string529  - name: corpus-id530    dtype: string531  - name: score532    dtype: int64533  splits:534  - name: dev535    num_bytes: 373821536    num_examples: 13100537  download_size: 134522538  dataset_size: 373821539- config_name: ru-queries540  features:541  - name: _id542    dtype: string543  - name: text544    dtype: string545  splits:546  - name: dev547    num_bytes: 116037548    num_examples: 1252549  download_size: 67086550  dataset_size: 116037551- config_name: sw-corpus552  features:553  - name: _id554    dtype: string555  - name: text556    dtype: string557  - name: title558    dtype: string559  splits:560  - name: dev561    num_bytes: 32766816562    num_examples: 131924563  download_size: 16589955564  dataset_size: 32766816565- config_name: sw-qrels566  features:567  - name: query-id568    dtype: string569  - name: corpus-id570    dtype: string571  - name: score572    dtype: int64573  splits:574  - name: dev575    num_bytes: 135409576    num_examples: 5092577  download_size: 44041578  dataset_size: 135409579- config_name: sw-queries580  features:581  - name: _id582    dtype: string583  - name: text584    dtype: string585  splits:586  - name: dev587    num_bytes: 24357588    num_examples: 482589  download_size: 15546590  dataset_size: 24357591- config_name: te-corpus592  features:593  - name: _id594    dtype: string595  - name: text596    dtype: string597  - name: title598    dtype: string599  splits:600  - name: dev601    num_bytes: 549992531602    num_examples: 518079603  download_size: 149672222604  dataset_size: 549992531605- config_name: te-qrels606  features:607  - name: query-id608    dtype: string609  - name: corpus-id610    dtype: string611  - name: score612    dtype: int64613  splits:614  - name: dev615    num_bytes: 43268616    num_examples: 1606617  download_size: 19278618  dataset_size: 43268619- config_name: te-queries620  features:621  - name: _id622    dtype: string623  - name: text624    dtype: string625  splits:626  - name: dev627    num_bytes: 95102628    num_examples: 828629  download_size: 38384630  dataset_size: 95102631- config_name: th-corpus632  features:633  - name: _id634    dtype: string635  - name: text636    dtype: string637  - name: title638    dtype: string639  splits:640  - name: dev641    num_bytes: 549881577642    num_examples: 542166643  download_size: 201796559644  dataset_size: 549881577645- config_name: th-qrels646  features:647  - name: query-id648    dtype: string649  - name: corpus-id650    dtype: string651  - name: score652    dtype: int64653  splits:654  - name: dev655    num_bytes: 208002656    num_examples: 7573657  download_size: 71074658  dataset_size: 208002659- config_name: th-queries660  features:661  - name: _id662    dtype: string663  - name: text664    dtype: string665  splits:666  - name: dev667    num_bytes: 98697668    num_examples: 733669  download_size: 44774670  dataset_size: 98697671- config_name: yo-corpus672  features:673  - name: _id674    dtype: string675  - name: text676    dtype: string677  - name: title678    dtype: string679  splits:680  - name: dev681    num_bytes: 10639617682    num_examples: 49043683  download_size: 5157335684  dataset_size: 10639617685- config_name: yo-qrels686  features:687  - name: query-id688    dtype: string689  - name: corpus-id690    dtype: string691  - name: score692    dtype: int64693  splits:694  - name: dev695    num_bytes: 35512696    num_examples: 1188697  download_size: 10613698  dataset_size: 35512699- config_name: yo-queries700  features:701  - name: _id702    dtype: string703  - name: text704    dtype: string705  splits:706  - name: dev707    num_bytes: 6697708    num_examples: 119709  download_size: 5615710  dataset_size: 6697711- config_name: zh-corpus712  features:713  - name: _id714    dtype: string715  - name: text716    dtype: string717  - name: title718    dtype: string719  splits:720  - name: dev721    num_bytes: 1718428423722    num_examples: 4934368723  download_size: 1092221644724  dataset_size: 1718428423725- config_name: zh-qrels726  features:727  - name: query-id728    dtype: string729  - name: corpus-id730    dtype: string731  - name: score732    dtype: int64733  splits:734  - name: dev735    num_bytes: 129492736    num_examples: 3928737  download_size: 42650738  dataset_size: 129492739- config_name: zh-queries740  features:741  - name: _id742    dtype: string743  - name: text744    dtype: string745  splits:746  - name: dev747    num_bytes: 19261748    num_examples: 393749  download_size: 13803750  dataset_size: 19261751configs:752- config_name: ar-corpus753  data_files:754  - split: dev755    path: ar-corpus/dev-*756- config_name: ar-qrels757  data_files:758  - split: dev759    path: ar-qrels/dev-*760- config_name: ar-queries761  data_files:762  - split: dev763    path: ar-queries/dev-*764- config_name: bn-corpus765  data_files:766  - split: dev767    path: bn-corpus/dev-*768- config_name: bn-qrels769  data_files:770  - split: dev771    path: bn-qrels/dev-*772- config_name: bn-queries773  data_files:774  - split: dev775    path: bn-queries/dev-*776- config_name: de-corpus777  data_files:778  - split: dev779    path: de-corpus/dev-*780- config_name: de-qrels781  data_files:782  - split: dev783    path: de-qrels/dev-*784- config_name: de-queries785  data_files:786  - split: dev787    path: de-queries/dev-*788- config_name: en-corpus789  data_files:790  - split: dev791    path: en-corpus/dev-*792- config_name: en-qrels793  data_files:794  - split: dev795    path: en-qrels/dev-*796- config_name: en-queries797  data_files:798  - split: dev799    path: en-queries/dev-*800- config_name: es-corpus801  data_files:802  - split: dev803    path: es-corpus/dev-*804- config_name: es-qrels805  data_files:806  - split: dev807    path: es-qrels/dev-*808- config_name: es-queries809  data_files:810  - split: dev811    path: es-queries/dev-*812- config_name: fa-corpus813  data_files:814  - split: dev815    path: fa-corpus/dev-*816- config_name: fa-qrels817  data_files:818  - split: dev819    path: fa-qrels/dev-*820- config_name: fa-queries821  data_files:822  - split: dev823    path: fa-queries/dev-*824- config_name: fi-corpus825  data_files:826  - split: dev827    path: fi-corpus/dev-*828- config_name: fi-qrels829  data_files:830  - split: dev831    path: fi-qrels/dev-*832- config_name: fi-queries833  data_files:834  - split: dev835    path: fi-queries/dev-*836- config_name: fr-corpus837  data_files:838  - split: dev839    path: fr-corpus/dev-*840- config_name: fr-qrels841  data_files:842  - split: dev843    path: fr-qrels/dev-*844- config_name: fr-queries845  data_files:846  - split: dev847    path: fr-queries/dev-*848- config_name: hi-corpus849  data_files:850  - split: dev851    path: hi-corpus/dev-*852- config_name: hi-qrels853  data_files:854  - split: dev855    path: hi-qrels/dev-*856- config_name: hi-queries857  data_files:858  - split: dev859    path: hi-queries/dev-*860- config_name: id-corpus861  data_files:862  - split: dev863    path: id-corpus/dev-*864- config_name: id-qrels865  data_files:866  - split: dev867    path: id-qrels/dev-*868- config_name: id-queries869  data_files:870  - split: dev871    path: id-queries/dev-*872- config_name: ja-corpus873  data_files:874  - split: dev875    path: ja-corpus/dev-*876- config_name: ja-qrels877  data_files:878  - split: dev879    path: ja-qrels/dev-*880- config_name: ja-queries881  data_files:882  - split: dev883    path: ja-queries/dev-*884- config_name: ko-corpus885  data_files:886  - split: dev887    path: ko-corpus/dev-*888- config_name: ko-qrels889  data_files:890  - split: dev891    path: ko-qrels/dev-*892- config_name: ko-queries893  data_files:894  - split: dev895    path: ko-queries/dev-*896- config_name: ru-corpus897  data_files:898  - split: dev899    path: ru-corpus/dev-*900- config_name: ru-qrels901  data_files:902  - split: dev903    path: ru-qrels/dev-*904- config_name: ru-queries905  data_files:906  - split: dev907    path: ru-queries/dev-*908- config_name: sw-corpus909  data_files:910  - split: dev911    path: sw-corpus/dev-*912- config_name: sw-qrels913  data_files:914  - split: dev915    path: sw-qrels/dev-*916- config_name: sw-queries917  data_files:918  - split: dev919    path: sw-queries/dev-*920- config_name: te-corpus921  data_files:922  - split: dev923    path: te-corpus/dev-*924- config_name: te-qrels925  data_files:926  - split: dev927    path: te-qrels/dev-*928- config_name: te-queries929  data_files:930  - split: dev931    path: te-queries/dev-*932- config_name: th-corpus933  data_files:934  - split: dev935    path: th-corpus/dev-*936- config_name: th-qrels937  data_files:938  - split: dev939    path: th-qrels/dev-*940- config_name: th-queries941  data_files:942  - split: dev943    path: th-queries/dev-*944- config_name: yo-corpus945  data_files:946  - split: dev947    path: yo-corpus/dev-*948- config_name: yo-qrels949  data_files:950  - split: dev951    path: yo-qrels/dev-*952- config_name: yo-queries953  data_files:954  - split: dev955    path: yo-queries/dev-*956- config_name: zh-corpus957  data_files:958  - split: dev959    path: zh-corpus/dev-*960- config_name: zh-qrels961  data_files:962  - split: dev963    path: zh-qrels/dev-*964- config_name: zh-queries965  data_files:966  - split: dev967    path: zh-queries/dev-*968tags:969- mteb970- text971---972<!-- adapted from https://github.com/huggingface/huggingface_hub/blob/v0.30.2/src/huggingface_hub/templates/datasetcard_template.md -->973 974<div align="center" style="padding: 40px 20px; background-color: white; border-radius: 12px; box-shadow: 0 2px 10px rgba(0, 0, 0, 0.05); max-width: 600px; margin: 0 auto;">975  <h1 style="font-size: 3.5rem; color: #1a1a1a; margin: 0 0 20px 0; letter-spacing: 2px; font-weight: 700;">MIRACLRetrieval</h1>976  <div style="font-size: 1.5rem; color: #4a4a4a; margin-bottom: 5px; font-weight: 300;">An <a href="https://github.com/embeddings-benchmark/mteb" style="color: #2c5282; font-weight: 600; text-decoration: none;" onmouseover="this.style.textDecoration='underline'" onmouseout="this.style.textDecoration='none'">MTEB</a> dataset</div>977  <div style="font-size: 0.9rem; color: #2c5282; margin-top: 10px;">Massive Text Embedding Benchmark</div>978</div>979 980MIRACL (Multilingual Information Retrieval Across a Continuum of Languages) is a multilingual retrieval dataset that focuses on search across 18 different languages.981 982|               |                                             |983|---------------|---------------------------------------------|984| Task category | t2t                              |985| Domains       | Encyclopaedic, Written                               |986| Reference     | http://miracl.ai/ |987 988 989 990 991## How to evaluate on this task992 993You can evaluate an embedding model on this dataset using the following code:994 995```python996import mteb997 998task = mteb.get_tasks(["MIRACLRetrieval"])999evaluator = mteb.MTEB(task)1000 1001model = mteb.get_model(YOUR_MODEL)1002evaluator.run(model)1003```1004 1005<!-- Datasets want link to arxiv in readme to autolink dataset with paper -->1006To learn more about how to run models on `mteb` task check out the [GitHub repitory](https://github.com/embeddings-benchmark/mteb).1007 1008## Citation1009 1010If you use this dataset, please cite the dataset as well as [mteb](https://github.com/embeddings-benchmark/mteb), as this dataset likely includes additional processing as a part of the [MMTEB Contribution](https://github.com/embeddings-benchmark/mteb/tree/main/docs/mmteb).1011 1012```bibtex1013 1014@article{10.1162/tacl_a_00595,1015  abstract = {{MIRACL is a multilingual dataset for ad hoc retrieval across 18 languages that collectively encompass over three billion native speakers around the world. This resource is designed to support monolingual retrieval tasks, where the queries and the corpora are in the same language. In total, we have gathered over 726k high-quality relevance judgments for 78k queries over Wikipedia in these languages, where all annotations have been performed by native speakers hired by our team. MIRACL covers languages that are both typologically close as well as distant from 10 language families and 13 sub-families, associated with varying amounts of publicly available resources. Extensive automatic heuristic verification and manual assessments were performed during the annotation process to control data quality. In total, MIRACL represents an investment of around five person-years of human annotator effort. Our goal is to spur research on improving retrieval across a continuum of languages, thus enhancing information access capabilities for diverse populations around the world, particularly those that have traditionally been underserved. MIRACL is available at http://miracl.ai/.}},1016  author = {Zhang, Xinyu and Thakur, Nandan and Ogundepo, Odunayo and Kamalloo, Ehsan and Alfonso-Hermelo, David and Li, Xiaoguang and Liu, Qun and Rezagholizadeh, Mehdi and Lin, Jimmy},1017  doi = {10.1162/tacl_a_00595},1018  eprint = {https://direct.mit.edu/tacl/article-pdf/doi/10.1162/tacl\_a\_00595/2157340/tacl\_a\_00595.pdf},1019  issn = {2307-387X},1020  journal = {Transactions of the Association for Computational Linguistics},1021  month = {09},1022  pages = {1114-1131},1023  title = {{MIRACL: A Multilingual Retrieval Dataset Covering 18 Diverse Languages}},1024  url = {https://doi.org/10.1162/tacl\_a\_00595},1025  volume = {11},1026  year = {2023},1027}1028 1029 1030@article{enevoldsen2025mmtebmassivemultilingualtext,1031  title={MMTEB: Massive Multilingual Text Embedding Benchmark},1032  author={Kenneth Enevoldsen and Isaac Chung and Imene Kerboua and Márton Kardos and Ashwin Mathur and David Stap and Jay Gala and Wissam Siblini and Dominik Krzemiński and Genta Indra Winata and Saba Sturua and Saiteja Utpala and Mathieu Ciancone and Marion Schaeffer and Gabriel Sequeira and Diganta Misra and Shreeya Dhakal and Jonathan Rystrøm and Roman Solomatin and Ömer Çağatan and Akash Kundu and Martin Bernstorff and Shitao Xiao and Akshita Sukhlecha and Bhavish Pahwa and Rafał Poświata and Kranthi Kiran GV and Shawon Ashraf and Daniel Auras and Björn Plüster and Jan Philipp Harries and Loïc Magne and Isabelle Mohr and Mariya Hendriksen and Dawei Zhu and Hippolyte Gisserot-Boukhlef and Tom Aarsen and Jan Kostkan and Konrad Wojtasik and Taemin Lee and Marek Šuppa and Crystina Zhang and Roberta Rocca and Mohammed Hamdy and Andrianos Michail and John Yang and Manuel Faysse and Aleksei Vatolin and Nandan Thakur and Manan Dey and Dipam Vasani and Pranjal Chitale and Simone Tedeschi and Nguyen Tai and Artem Snegirev and Michael Günther and Mengzhou Xia and Weijia Shi and Xing Han Lù and Jordan Clive and Gayatri Krishnakumar and Anna Maksimova and Silvan Wehrli and Maria Tikhonova and Henil Panchal and Aleksandr Abramov and Malte Ostendorff and Zheng Liu and Simon Clematide and Lester James Miranda and Alena Fenogenova and Guangyu Song and Ruqiya Bin Safi and Wen-Ding Li and Alessia Borghini and Federico Cassano and Hongjin Su and Jimmy Lin and Howard Yen and Lasse Hansen and Sara Hooker and Chenghao Xiao and Vaibhav Adlakha and Orion Weller and Siva Reddy and Niklas Muennighoff},1033  publisher = {arXiv},1034  journal={arXiv preprint arXiv:2502.13595},1035  year={2025},1036  url={https://arxiv.org/abs/2502.13595},1037  doi = {10.48550/arXiv.2502.13595},1038}1039 1040@article{muennighoff2022mteb,1041  author = {Muennighoff, Niklas and Tazi, Nouamane and Magne, Lo{\"\i}c and Reimers, Nils},1042  title = {MTEB: Massive Text Embedding Benchmark},1043  publisher = {arXiv},1044  journal={arXiv preprint arXiv:2210.07316},1045  year = {2022}1046  url = {https://arxiv.org/abs/2210.07316},1047  doi = {10.48550/ARXIV.2210.07316},1048}1049```1050 1051# Dataset Statistics1052<details>1053  <summary> Dataset Statistics</summary>1054 1055The following code contains the descriptive statistics from the task. These can also be obtained using:1056 1057```python1058import mteb1059 1060task = mteb.get_task("MIRACLRetrieval")1061 1062desc_stats = task.metadata.descriptive_stats1063```1064 1065```json1066{1067    "dev": {1068        "num_samples": 106345647,1069        "number_of_characters": 37176781172,1070        "num_documents": 106332152,1071        "min_document_length": 2,1072        "average_document_length": 349.6241542163089,1073        "max_document_length": 84930,1074        "unique_documents": 106332152,1075        "num_queries": 13495,1076        "min_query_length": 5,1077        "average_query_length": 36.49225639125602,1078        "max_query_length": 176,1079        "unique_queries": 13495,1080        "none_queries": 0,1081        "num_relevant_docs": 130408,1082        "min_relevant_docs_per_query": 1,1083        "average_relevant_docs_per_query": 2.3059651722860317,1084        "max_relevant_docs_per_query": 20,1085        "unique_relevant_docs": 119924,1086        "num_instructions": null,1087        "min_instruction_length": null,1088        "average_instruction_length": null,1089        "max_instruction_length": null,1090        "unique_instructions": null,1091        "num_top_ranked": null,1092        "min_top_ranked_per_query": null,1093        "average_top_ranked_per_query": null,1094        "max_top_ranked_per_query": null1095    }1096}1097```1098 1099</details>1100 1101---1102*This dataset card was automatically generated using [MTEB](https://github.com/embeddings-benchmark/mteb)*