CoolFace
Datasetpublic

universalner/uner_llm_instructions

Dataset Card for Universal NER v1 in the Aya format This dataset is a format conversion from its original v1 format into the Aya instruction format and it's released here under the same CC-BY-SA 4.0 license and conditions. It contains data in multiple languages and this version is intended for multi-lingual LLM construction/tuning. The dataset contains different subsets and their dev/test/train splits, depending on language. Citation If you utilize this dataset… See the full description on the dataset page: https://huggingface.co/datasets/universalner/uner_llm_instructions.

sourceHugging Facecc-by-sa-4.0updated 3y agoView on Hugging Face
2likes527downloads
README.md156 linesDownload Raw Back to root
1---2license: cc-by-sa-4.03language:4  - ceb5  - da6  - de7  - en8  - hr9  - pt10  - ru11  - sk12  - sr13  - sv14  - tl15  - zh16task_categories:17- token-classification18dataset_info:19- config_name: en_pud20  splits:21  - name: test22    num_examples: 99923- config_name: pt_pud24  splits:25  - name: test26    num_examples: 99927- config_name: sv_pud28  splits:29  - name: test30    num_examples: 99931- config_name: de_pud32  splits:33  - name: test34    num_examples: 99935- config_name: ru_pud36  splits:37  - name: test38    num_examples: 99939- config_name: zh_pud40  splits:41  - name: test42    num_examples: 99943- config_name: en_ewt44  splits:45  - name: test46    num_examples: 207647  - name: dev48    num_examples: 200049  - name: train50    num_examples: 1254251- config_name: da_ddt52  splits:53  - name: test54    num_examples: 56455  - name: dev56    num_examples: 56357  - name: train58    num_examples: 438259- config_name: hr_set60  splits:61  - name: test62    num_examples: 113563  - name: dev64    num_examples: 95965  - name: train66    num_examples: 691767- config_name: sr_set68  splits:69  - name: test70    num_examples: 51971  - name: dev72    num_examples: 53573  - name: train74    num_examples: 332775- config_name: pt_bosque76  splits:77  - name: test78    num_examples: 116679  - name: dev80    num_examples: 117181  - name: train82    num_examples: 430283- config_name: sk_snk84  splits:85  - name: test86    num_examples: 106087  - name: dev88    num_examples: 105989  - name: train90    num_examples: 848291- config_name: sv_talbanken92  splits:93  - name: test94    num_examples: 121895  - name: dev96    num_examples: 50397  - name: train98    num_examples: 430299- config_name: tl_trg100  splits:101  - name: test102    num_examples: 127103- config_name: tl_ugnayan104  splits:105  - name: test106    num_examples: 93107- config_name: zh_gsd108  splits:109  - name: test110    num_examples: 499111  - name: dev112    num_examples: 499113  - name: train114    num_examples: 3996115- config_name: zh_gsdsimp116  splits:117  - name: test118    num_examples: 499119  - name: dev120    num_examples: 499121  - name: train122    num_examples: 3996123---124 125# Dataset Card for Universal NER v1 in the Aya format126 127This dataset is a format conversion from its original v1 format into the Aya instruction format and it's released here under the same CC-BY-SA 4.0 license and conditions.128 129It contains data in multiple languages and this version is intended for multi-lingual LLM construction/tuning.130 131The dataset contains different subsets and their dev/test/train splits, depending on language. 132 133## Citation134 135If you utilize this dataset version, feel free to cite/footnote this huggingface dataset repo, but please also cite the original dataset publication.136 137**BibTeX:**138 139```140@preprint{mayhew2023universal,141  title={{Universal NER: A Gold-Standard Multilingual Named Entity Recognition Benchmark}}, 142  author={Stephen Mayhew and Terra Blevins and Shuheng Liu and Marek Šuppa and Hila Gonen and Joseph Marvin Imperial and Börje F. Karlsson and Peiqin Lin and Nikola Ljubešić and LJ Miranda and Barbara Plank and Arij Riabi and Yuval Pinter},143  year={2023},144  eprint={2311.09122},145  archivePrefix={arXiv},146  primaryClass={cs.CL}147}148```149 150## Dataset Details151 152For the original Universal NER dataset v1 and more details, please check https://huggingface.co/datasets/universalner/universal_ner.153 154## Format Conversion Details155 156The templates used to reformat the dataset are in the ./templates-uner directory.