pszemraj/simplepile-lite
Dataset Card for "simplepile-lite" Interleaved dataset using 'first exhausted' strategy. Counts: DatasetDict({ train: Dataset({ features: ['text'], num_rows: 452432 }) validation: Dataset({ features: ['text'], num_rows: 1000 }) test: Dataset({ features: ['text'], num_rows: 11908 }) }) token counts - train using GPTNeoX Tokenizer: token_count count 452432 mean 868.642 std… See the full description on the dataset page: https://huggingface.co/datasets/pszemraj/simplepile-lite.
197
../
test-00000-of-00001-27de0fd571b5df49.parquetdownload
train-00000-of-00004-12a9e5dc8d757c6b.parquetdownload
train-00001-of-00004-25d00f7aa3d8b8b5.parquetdownload
train-00002-of-00004-b5f5566050497ee7.parquetdownload
train-00003-of-00004-2235011c74fec1f9.parquetdownload
validation-00000-of-00001-6eeadc5d7fc42259.parquetdownload
