HauserGroup/ApeTokenizer-SMILES
1
1{2 "ape_source": "modernmolbert.local",3 "created_at_utc": "2026-05-22T04:05:53.431998+00:00",4 "creation_command": "python -m modernmolbert.train_ape_tokenizer",5 "dataset_name": "data/pretrain/chembl36_selfies",6 "extra_vocab_selfies_path": null,7 "extra_vocab_symbols_added": 0,8 "extra_vocab_symbols_path": null,9 "extra_vocab_symbols_requested": 0,10 "max_merge_pieces": 6,11 "max_vocab_size": 2000,12 "min_freq_for_merge": 3000,13 "molecule_column": "smiles_canonical_clean",14 "representation": "SMILES",15 "seed": 42,16 "shuffle_buffer_size": 100000,17 "special_ids": {18 "bos_token": 0,19 "eos_token": 2,20 "mask_token": 4,21 "pad_token": 1,22 "unk_token": 323 },24 "tokenizer_path": "tokenizer/chembl36_smiles_2m_ape_max6_mf3000.json",25 "tokenizer_sha256": "faf7748e8959b252c9d0ad83c2228df37a45dc9a68c15ead1ced2942cc8f155e",26 "tokenizer_train_size": 2000000,27 "vocab_size": 138628}29 