pszemraj/simplepile-lite
Dataset Card for "simplepile-lite" Interleaved dataset using 'first exhausted' strategy. Counts: DatasetDict({ train: Dataset({ features: ['text'], num_rows: 452432 }) validation: Dataset({ features: ['text'], num_rows: 1000 }) test: Dataset({ features: ['text'], num_rows: 11908 }) }) token counts - train using GPTNeoX Tokenizer: token_count count 452432 mean 868.642 std… See the full description on the dataset page: https://huggingface.co/datasets/pszemraj/simplepile-lite.
197
Dataset Card for "simplepile-lite"
Interleaved dataset using 'first exhausted' strategy. Counts:
DatasetDict({
train: Dataset({
features: ['text'],
num_rows: 452432
})
validation: Dataset({
features: ['text'],
num_rows: 1000
})
test: Dataset({
features: ['text'],
num_rows: 11908
})
})token counts - train
using GPTNeoX Tokenizer:
