CoolFace
Datasetpublic

ashvardanian/StringWars

StringKilla - Small Datasets for String Algorithms Benchmarking The goal of this dataset is to provide a fairly diverse set of strings to evalute the performance of various string-processing algorithms in StringZilla and beyond. English Texts English Leipzig Corpora Collection 124 MB uncompressed 1'000'000 lines of ASCII 8'388'608 tokens of mean length 5 The dataset was originally pulled from Princeton's website: wget --no-clobber -O leipzig1M.txt… See the full description on the dataset page: https://huggingface.co/datasets/ashvardanian/StringWars.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
1likes136downloads
13 commits on main
0bc49361y ago

Update README.md

ashvardanian
41596f91y ago

Upload acgt_10m.txt with huggingface_hub

ashvardanian
a34032b1y ago

Upload xlsum.csv with huggingface_hub

ashvardanian
65718511y ago

Upload enwik9.txt with huggingface_hub

ashvardanian
59f41e11y ago

Upload leipzig1M.txt with huggingface_hub

ashvardanian
78ff6631y ago

Upload utf8.txt with huggingface_hub

ashvardanian
8a731061y ago

Upload acgt_100k.txt with huggingface_hub

ashvardanian
174cf711y ago

Upload acgt_100.txt with huggingface_hub

ashvardanian
8336d101y ago

Upload acgt_10k.txt with huggingface_hub

ashvardanian
e97cc8f1y ago

Upload acgt_1m.txt with huggingface_hub

ashvardanian
2ff43c81y ago

Upload acgt_1k.txt with huggingface_hub

ashvardanian
91534a81y ago

Update README.md

ashvardanian
94eb5711y ago

initial commit

ashvardanian