CoolFace
Datasetpublic

ibm-aimc/sentencepiece-wikitext-103

Caution ⚠️ : This dataset is already tokenized using the sentencepiece tokenizer from "ibm-aimc/sigma-moe-small". This dataset is an adapted version from https://huggingface.co/datasets/EleutherAI/wikitext_document_level which in turn is an adapted version of the dataset in https://huggingface.co/datasets/wikitext .

sourceHugging Facecc-by-sa-3.0updated 3y agoView on Hugging Face
0likes49downloads
Dataset Card

Caution ⚠️ : This dataset is already tokenized using the sentencepiece tokenizer from "ibm-aimc/sigma-moe-small".

This dataset is an adapted version from https://huggingface.co/datasets/EleutherAI/wikitextdocumentlevel which in turn is an adapted version of the dataset in https://huggingface.co/datasets/wikitext .