placeholderlabs/pretrain-ultra-fineweb-mix
Normalized documents plus aligned Dolma-2 tokens and target masks. Size Tokens 73,328,911,347 (73.3B) Trainable tokens 73,328,911,347 (73.3B) Documents 92,923,076 Shards 578 UTF-8 bytes 364,562,557,837 Tokenizer allenai/dolma2-tokenizer@5292e5d6c0f4 documents.parquet - document_id, text, part_ends, part_trainable, must_not_split. The readable payload and the mask intent. metadata.parquet - one text-free row per document: token span, source, stratum… See the full description on the dataset page: https://huggingface.co/datasets/placeholderlabs/pretrain-ultra-fineweb-mix.
Quote the token count in short form beside the exact figure
State the release size in tokens on the dataset card
Publish document-token mix 0fa7a48febfb
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
Add files using upload-large-folder tool
initial commit
