Nj-1111/Copernicus-Tokenizer
0
Copernicus Tokenizer
Domain-general BPE tokenizer trained from scratch on 3.96 million documents spanning natural language, code, mathematics, and scientific text.
Quick start
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("Nj-1111/Copernicus-Tokenizer")
ids = tokenizer("Hello, world!")
print(ids)Use in a training loop
from transformers import PreTrainedTokenizerFast
tokenizer = PreTrainedTokenizerFast.from_pretrained("Nj-1111/Copernicus-Tokenizer")
inputs = tokenizer(
["Hello world", "def foo(): pass"],
truncation=True,
max_length=2048,
padding="max_length",
return_tensors="pt",
)Special tokens
Training data
Training code: github.com/Nj-1111/copernicus-tokenizer
