CoolFace
Modelpublic

zluvolyote/CodonBert_CodonBased_Tokenizer

sourceHugging Faceupdated 4y agoView on Hugging Face
0likes
tokenizer.json173 linesDownload Raw Back to root
1{2  "version": "1.0",3  "truncation": null,4  "padding": null,5  "added_tokens": [6    {7      "id": 0,8      "content": "[UNK]",9      "single_word": false,10      "lstrip": false,11      "rstrip": false,12      "normalized": false,13      "special": true14    },15    {16      "id": 1,17      "content": "[PAD]",18      "single_word": false,19      "lstrip": false,20      "rstrip": false,21      "normalized": false,22      "special": true23    },24    {25      "id": 2,26      "content": "[CLS]",27      "single_word": false,28      "lstrip": false,29      "rstrip": false,30      "normalized": false,31      "special": true32    },33    {34      "id": 3,35      "content": "[SEP]",36      "single_word": false,37      "lstrip": false,38      "rstrip": false,39      "normalized": false,40      "special": true41    },42    {43      "id": 4,44      "content": "[MASK]",45      "single_word": false,46      "lstrip": false,47      "rstrip": false,48      "normalized": false,49      "special": true50    }51  ],52  "normalizer": {53    "type": "Sequence",54    "normalizers": [55      {56        "type": "NFD"57      },58      {59        "type": "StripAccents"60      }61    ]62  },63  "pre_tokenizer": {64    "type": "BertPreTokenizer"65  },66  "post_processor": null,67  "decoder": {68    "type": "WordPiece",69    "prefix": "##",70    "cleanup": true71  },72  "model": {73    "type": "WordPiece",74    "unk_token": "[UNK]",75    "continuing_subword_prefix": "##",76    "max_input_chars_per_word": 100,77    "vocab": {78      "[UNK]": 0,79      "[PAD]": 1,80      "[CLS]": 2,81      "[SEP]": 3,82      "[MASK]": 4,83      "A": 5,84      "C": 6,85      "G": 7,86      "T": 8,87      "##T": 9,88      "##G": 10,89      "##C": 11,90      "##A": 12,91      "AA": 13,92      "GA": 14,93      "TT": 15,94      "AT": 16,95      "##CT": 17,96      "##CA": 18,97      "CA": 19,98      "GT": 20,99      "AG": 21,100      "GG": 22,101      "GAA": 23,102      "##CC": 24,103      "AAA": 25,104      "CT": 26,105      "GAT": 27,106      "AAT": 28,107      "TA": 29,108      "AAG": 30,109      "ATT": 31,110      "##CG": 32,111      "CAA": 33,112      "TTG": 34,113      "TTA": 35,114      "TTT": 36,115      "AAC": 37,116      "TCT": 38,117      "GGT": 39,118      "TG": 40,119      "GTT": 41,120      "AGA": 42,121      "ATG": 43,122      "GCT": 44,123      "GAC": 45,124      "ACT": 46,125      "GAG": 47,126      "TCA": 48,127      "TAT": 49,128      "TTC": 50,129      "ATA": 51,130      "ACA": 52,131      "CCA": 53,132      "ATC": 54,133      "GCA": 55,134      "AGT": 56,135      "TAC": 57,136      "TCC": 58,137      "CAT": 59,138      "CTA": 60,139      "CCT": 61,140      "CG": 62,141      "CAG": 63,142      "GCC": 64,143      "ACC": 65,144      "CTT": 66,145      "GTA": 67,146      "GTC": 68,147      "GGA": 69,148      "GTG": 70,149      "CTG": 71,150      "TGG": 72,151      "AGC": 73,152      "GGC": 74,153      "AGG": 75,154      "TCG": 76,155      "ACG": 77,156      "TGT": 78,157      "CAC": 79,158      "CCC": 80,159      "CGT": 81,160      "GCG": 82,161      "GGG": 83,162      "CCG": 84,163      "CTC": 85,164      "TGC": 86,165      "CGA": 87,166      "CGC": 88,167      "CGG": 89,168      "TAA": 90,169      "TGA": 91,170      "TAG": 92171    }172  }173}