CoolFace
Datasetpublic

TemryL/tokenized_wikipedia_20220301.en_train_512

Tokenized English Wikipedia Dataset Dataset Description This dataset contains tokenized chunks of text from the English Wikipedia dump of March 1, 2022. Each entry in the dataset represents a chunk of text from Wikipedia, with information about which document and position within the document it comes from. Dataset Creation Source Dataset: Wikipedia (20220301.en) Tokenizer: BERT base uncased Chunk Size: 512 tokens (including special tokens)… See the full description on the dataset page: https://huggingface.co/datasets/TemryL/tokenized_wikipedia_20220301.en_train_512.

sourceHugging Facecc-by-sa-3.0updated 2y agoView on Hugging Face
0likes343downloads
24 commits on main
6baca5f2y ago

Update README.md

TemryL
ec029642y ago

Update README.md

TemryL
dc919772y ago

Upload dataset (part 00002-of-00003)

TemryL
64e49f62y ago

Upload dataset (part 00001-of-00003)

TemryL
df342d12y ago

Upload dataset (part 00000-of-00003)

TemryL
b8fc28e2y ago

Update README.md

TemryL
cb4049e2y ago

Upload dataset (part 00002-of-00003)

TemryL
07d2e7a2y ago

Upload dataset (part 00001-of-00003)

TemryL
dc9849c2y ago

Upload dataset (part 00000-of-00003)

TemryL
9dde8112y ago

Update README.md

TemryL
9276a7d2y ago

Update README.md

TemryL
13da2ad2y ago

Update README.md

TemryL
88904aa2y ago

Upload dataset

TemryL
79db0b22y ago

Update README.md

TemryL
f0ff5822y ago

Upload dataset (part 00001-of-00002)

TemryL
77ac16e2y ago

Upload dataset (part 00000-of-00002)

TemryL
8a4ad482y ago

Upload dataset

TemryL
e9cded12y ago

Update README.md

TemryL
b0ed4e82y ago

Update README.md

TemryL
342c06b2y ago

Update README.md

TemryL
8e3f0962y ago

Update README.md

TemryL
42a57542y ago

Upload dataset (part 00001-of-00002)

TemryL
31eab4e2y ago

Upload dataset (part 00000-of-00002)

TemryL
7f4ffa02y ago

initial commit

TemryL