CoolFace
Datasetpublic

lingvanex/lingvanex_test_references

LTR LTR -- Lingvanex Test References for MT Evaluation from English into a total of 30 target languages for a big variety of cases. TEST CASES Parameter Description Length Sentences from 1 to 100 words. Domain Medicine (12%), Automobile (11%), Finance (8%) Tokenizer Jupiter is 1.000.000 km far. Ask Mr. Johnson for training Tags I want to eat and swim Capitalisation (Case) HELLO my Dear frIEND Different languages in one text (Up to 3… See the full description on the dataset page: https://huggingface.co/datasets/lingvanex/lingvanex_test_references.

sourceHugging Facecc-by-nc-sa-4.0updated 3y agoView on Hugging Face
2likes89downloads
README.md206 linesDownload Raw Back to root
1---2task_categories:3  - translation4multilinguality:5  - translation6task_ids: []7language:8  - af9  - ar10  - be11  - bp12  - bs13  - cs14  - da15  - de16  - el17  - es18  - et19  - fa20  - fi21  - fr22  - he23  - hu24  - id25  - it26  - lt27  - lv28  - no29  - pl30  - pt31  - ro32  - ru33  - sq34  - sr35  - sv36  - tr37  - uk38size_categories:39  - 1K<n<10K40 41configs:42  - config_name: en-cs43    data_files:44      - split: test45        path: data/en-cs.csv46  - config_name: en-et47    data_files:48      - split: test49        path: data/en-et.csv50  - config_name: en-hu51    data_files:52      - split: test53        path: data/en-hu.csv54  - config_name: en-no55    data_files:56      - split: test57        path: data/en-no.csv58  - config_name: en-ru59    data_files:60      - split: test61        path: data/en-ru.csv62  - config_name: en-uk63    data_files:64      - split: test65        path: data/en-uk.csv66  - config_name: en-af67    data_files:68      - split: test69        path: data/en-af.csv70  - config_name: en-da71    data_files:72      - split: test73        path: data/en-da.csv74  - config_name: en-fa75    data_files:76      - split: test77        path: data/en-fa.csv78  - config_name: en-id79    data_files:80      - split: test81        path: data/en-id.csv82  - config_name: en-pl83    data_files:84      - split: test85        path: data/en-pl.csv86  - config_name: en-sq87    data_files:88      - split: test89        path: data/en-sq.csv90  - config_name: en-ar91    data_files:92      - split: test93        path: data/en-ar.csv94  - config_name: en-de95    data_files:96      - split: test97        path: data/en-de.csv98  - config_name: en-fi99    data_files:100      - split: test101        path: data/en-fi.csv102  - config_name: en-it103    data_files:104      - split: test105        path: data/en-it.csv106  - config_name: en-pt_br107    data_files:108      - split: test109        path: data/en-pt_br.csv110  - config_name: en-sr111    data_files:112      - split: test113        path: data/en-sr.csv114  - config_name: en-be115    data_files:116      - split: test117        path: data/en-be.csv118  - config_name: en-el119    data_files:120      - split: test121        path: data/en-el.csv122  - config_name: en-fr123    data_files:124      - split: test125        path: data/en-fr.csv126  - config_name: en-lt127    data_files:128      - split: test129        path: data/en-lt.csv130  - config_name: en-pt131    data_files:132      - split: test133        path: data/en-pt.csv134  - config_name: en-sv135    data_files:136      - split: test137        path: data/en-sv.csv138  - config_name: en-bs139    data_files:140      - split: test141        path: data/en-bs.csv142  - config_name: en-es143    data_files:144      - split: test145        path: data/en-es.csv146  - config_name: en-he147    data_files:148      - split: test149        path: data/en-he.csv150  - config_name: en-lv151    data_files:152      - split: test153        path: data/en-lv.csv154  - config_name: en-ro155    data_files:156      - split: test157        path: data/en-ro.csv158  - config_name: en-tr159    data_files:160      - split: test161        path: data/en-tr.csv162  - config_name: en-uk163    data_files:164      - split: test165        path: data/en-uk.csv166 167license: cc-by-nc-sa-4.0168---169 170# LTR171LTR -- Lingvanex Test References for MT Evaluation from English into a total of 30 target languages for a big variety of cases.172 173## TEST CASES174 175| Parameter | Description |176|-----------|-------------|177| Length    | Sentences from 1 to 100 words.       |178| Domain    | Medicine (12%), Automobile (11%), Finance (8%) |179| Tokenizer    | Jupiter is 1.000.000 km far. Ask Mr. Johnson for training       |180| Tags    | I want to eat <tag> and swim       |181| Capitalisation (Case)    | HELLO my Dear frIEND |182| Different languages in one text (Up to 3 languages)    | I see "Купалинка" performance near the theater. |183| Styling    | Hello Dude!      |184| Errors (Grammar, OCR)    | I neet (need) to buy a kat (cat)|185| Abbreviations    | The model was named 15.BVcX-10     |186| Named Entities    | Let’s go to New York city      |187| Idioms    | A piece of cake. Once in a blue moon’       |188| Formulas (Math, Physics, Chemistry)    | Cr2(SO4)3 + CO2 + H2O + K2SO4 + KNO3 |189| Romanian numbers    | It was in MCMXVII year |190| Unicode Special Characters    | №%&*/#  |191 192# Updates193Data package has been released on 11/18/2023. Enjoy!194 195# License196The LTR data set is released under the [CC BY-SA 4.0 license](https://huggingface.co/datasets/lingvanex/lingvanex_test_references/blob/main/LICENSE.md).197# How to Cite198```199@inproceedings{200    title = "{LTR} Lingvanex Test References for {MT} Evaluation",201    author = "Aliaksei Rudak",202    url = "https://lingvanex.com",203    Year = "2023"204}205```206