universalner/uner_llm_instructions
Dataset Card for Universal NER v1 in the Aya format This dataset is a format conversion from its original v1 format into the Aya instruction format and it's released here under the same CC-BY-SA 4.0 license and conditions. It contains data in multiple languages and this version is intended for multi-lingual LLM construction/tuning. The dataset contains different subsets and their dev/test/train splits, depending on language. Citation If you utilize this dataset… See the full description on the dataset page: https://huggingface.co/datasets/universalner/uner_llm_instructions.
2527
1---2license: cc-by-sa-4.03language:4 - ceb5 - da6 - de7 - en8 - hr9 - pt10 - ru11 - sk12 - sr13 - sv14 - tl15 - zh16task_categories:17- token-classification18dataset_info:19- config_name: en_pud20 splits:21 - name: test22 num_examples: 99923- config_name: pt_pud24 splits:25 - name: test26 num_examples: 99927- config_name: sv_pud28 splits:29 - name: test30 num_examples: 99931- config_name: de_pud32 splits:33 - name: test34 num_examples: 99935- config_name: ru_pud36 splits:37 - name: test38 num_examples: 99939- config_name: zh_pud40 splits:41 - name: test42 num_examples: 99943- config_name: en_ewt44 splits:45 - name: test46 num_examples: 207647 - name: dev48 num_examples: 200049 - name: train50 num_examples: 1254251- config_name: da_ddt52 splits:53 - name: test54 num_examples: 56455 - name: dev56 num_examples: 56357 - name: train58 num_examples: 438259- config_name: hr_set60 splits:61 - name: test62 num_examples: 113563 - name: dev64 num_examples: 95965 - name: train66 num_examples: 691767- config_name: sr_set68 splits:69 - name: test70 num_examples: 51971 - name: dev72 num_examples: 53573 - name: train74 num_examples: 332775- config_name: pt_bosque76 splits:77 - name: test78 num_examples: 116679 - name: dev80 num_examples: 117181 - name: train82 num_examples: 430283- config_name: sk_snk84 splits:85 - name: test86 num_examples: 106087 - name: dev88 num_examples: 105989 - name: train90 num_examples: 848291- config_name: sv_talbanken92 splits:93 - name: test94 num_examples: 121895 - name: dev96 num_examples: 50397 - name: train98 num_examples: 430299- config_name: tl_trg100 splits:101 - name: test102 num_examples: 127103- config_name: tl_ugnayan104 splits:105 - name: test106 num_examples: 93107- config_name: zh_gsd108 splits:109 - name: test110 num_examples: 499111 - name: dev112 num_examples: 499113 - name: train114 num_examples: 3996115- config_name: zh_gsdsimp116 splits:117 - name: test118 num_examples: 499119 - name: dev120 num_examples: 499121 - name: train122 num_examples: 3996123---124 125# Dataset Card for Universal NER v1 in the Aya format126 127This dataset is a format conversion from its original v1 format into the Aya instruction format and it's released here under the same CC-BY-SA 4.0 license and conditions.128 129It contains data in multiple languages and this version is intended for multi-lingual LLM construction/tuning.130 131The dataset contains different subsets and their dev/test/train splits, depending on language. 132 133## Citation134 135If you utilize this dataset version, feel free to cite/footnote this huggingface dataset repo, but please also cite the original dataset publication.136 137**BibTeX:**138 139```140@preprint{mayhew2023universal,141 title={{Universal NER: A Gold-Standard Multilingual Named Entity Recognition Benchmark}}, 142 author={Stephen Mayhew and Terra Blevins and Shuheng Liu and Marek Šuppa and Hila Gonen and Joseph Marvin Imperial and Börje F. Karlsson and Peiqin Lin and Nikola Ljubešić and LJ Miranda and Barbara Plank and Arij Riabi and Yuval Pinter},143 year={2023},144 eprint={2311.09122},145 archivePrefix={arXiv},146 primaryClass={cs.CL}147}148```149 150## Dataset Details151 152For the original Universal NER dataset v1 and more details, please check https://huggingface.co/datasets/universalner/universal_ner.153 154## Format Conversion Details155 156The templates used to reformat the dataset are in the ./templates-uner directory.