CoolFace
Datasetpublic

marin-community/fineweb-edu-pretokenized-10B

Marin/Levanter Subsampled Pretokenized Dataset Dataset Train Urls: gs://marin-us-central2/raw/fineweb-edu-c2beb4/3c452cb/huggingface.co/datasets/HuggingFaceFW/fineweb-edu/resolve/3c452cb Factsheet Original cache: gs://marin-us-central2/tokenized/fineweb-edu-24698d Tokenizer: stanford-crfm/marin-tokenizer Seed 42 Number of tokens: 10,000,000,738 (This readme is automatically generated by Marin.)

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes236downloads
Dataset Card

Marin/Levanter Subsampled Pretokenized Dataset

Dataset

Train Urls:

  • —gs://marin-us-central2/raw/fineweb-edu-c2beb4/3c452cb/huggingface.co/datasets/HuggingFaceFW/fineweb-edu/resolve/3c452cb

Factsheet

  • —Original cache: gs://marin-us-central2/tokenized/fineweb-edu-24698d
  • —Tokenizer: stanford-crfm/marin-tokenizer
  • —Seed 42
  • —Number of tokens: 10,000,000,738

(This readme is automatically generated by Marin.)