CoolFace
Datasetpublic

pt-sk/pretraining-dataset

Tokens are prepared using TikToken's "cl100k_base" tokenizer, which is used for GPT3.5 and GPT4.

sourceHugging Facemitupdated 2y agoView on Hugging Face
1likes106downloads
Dataset Card

Tokens are prepared using TikToken's "cl100k_base" tokenizer, which is used for GPT3.5 and GPT4.