JamesConley/fineweb-sample-5.97B-512
FineWeb-Sample-5.97B-512 Dataset Description This dataset contains approximately 5.97 billion tokens (5,968,954,880 tokens) sampled from the FineWeb-Edu dataset. Each text sample is capped at a maximum of 512 tokens. Dataset Statistics Total Tokens: ~5.97B (5,968,954,880) Max Tokens per Sample: 512 Max Characters per Sample: 5,120 (10 chars/token estimate) Source Dataset: FineWeb-Edu 350BT Random Seed: 42 Dataset Structure The… See the full description on the dataset page: https://huggingface.co/datasets/JamesConley/fineweb-sample-5.97B-512.
0237
train_chunk_0000.parquetdownload
train_chunk_0001.parquetdownload
train_chunk_0002.parquetdownload
train_chunk_0003.parquetdownload
train_chunk_0004.parquetdownload
train_chunk_0005.parquetdownload
train_chunk_0006.parquetdownload
train_chunk_0007.parquetdownload
train_chunk_0008.parquetdownload
train_chunk_0009.parquetdownload
train_chunk_0010.parquetdownload
train_chunk_0011.parquetdownload
train_chunk_0012.parquetdownload
train_chunk_0013.parquetdownload
train_chunk_0014.parquetdownload
train_chunk_0015.parquetdownload
train_chunk_0016.parquetdownload
train_chunk_0017.parquetdownload
train_chunk_0018.parquetdownload
train_chunk_0019.parquetdownload
