Comet/wikipedia-2017-bm25
Wikipedia 2017 BM25 Search Index This dataset provides a production-ready BM25 search index over 5.2 million Wikipedia article abstracts from the 2017 snapshot. Built using the bm25s library with English stemming and optimized Parquet compression, it enables fast, offline information retrieval for research and production AI systems. The corpus is identical to the one used in influential AI research papers including DSPy and GEPA, ensuring reproducible benchmarking and fair… See the full description on the dataset page: https://huggingface.co/datasets/Comet/wikipedia-2017-bm25.
1356
corpus_0000.parquetdownload
corpus_0001.parquetdownload
corpus_0002.parquetdownload
corpus_0003.parquetdownload
corpus_0004.parquetdownload
corpus_0005.parquetdownload
corpus_0006.parquetdownload
corpus_0007.parquetdownload
corpus_0008.parquetdownload
corpus_0009.parquetdownload
corpus_0010.parquetdownload
corpus_0011.parquetdownload
corpus_0012.parquetdownload
corpus_0013.parquetdownload
corpus_0014.parquetdownload
corpus_0015.parquetdownload
corpus_0016.parquetdownload
corpus_0017.parquetdownload
corpus_0018.parquetdownload
corpus_0019.parquetdownload
corpus_0020.parquetdownload
corpus_0021.parquetdownload
corpus_0022.parquetdownload
corpus_0023.parquetdownload
corpus_0024.parquetdownload
corpus_0025.parquetdownload
corpus_0026.parquetdownload
corpus_0027.parquetdownload
corpus_0028.parquetdownload
corpus_0029.parquetdownload
corpus_0030.parquetdownload
corpus_0031.parquetdownload
corpus_0032.parquetdownload
corpus_0033.parquetdownload
corpus_0034.parquetdownload
corpus_0035.parquetdownload
corpus_0036.parquetdownload
corpus_0037.parquetdownload
corpus_0038.parquetdownload
corpus_0039.parquetdownload
corpus_0040.parquetdownload
corpus_0041.parquetdownload
corpus_0042.parquetdownload
corpus_0043.parquetdownload
corpus_0044.parquetdownload
corpus_0045.parquetdownload
corpus_0046.parquetdownload
corpus_0047.parquetdownload
corpus_0048.parquetdownload
corpus_0049.parquetdownload
corpus_0050.parquetdownload
corpus_0051.parquetdownload
corpus_0052.parquetdownload
data.csc.index.npydownload
indices.csc.index.npydownload
indptr.csc.index.npydownload
