pinecone
Datasets
All datasets matching “pinecone”msmarco-beir-e5msmarco-beir-constbertpinecone_test
Dataset Card for "pinecone_test"
More Information needed
core-2020-05-10-deduplication
Dataset Card for CORE Deduplication
Dataset Summary
CORE 2020 Deduplication dataset (https://core.ac.uk/documentation/dataset) contains 100K scholarly documents labeled as duplicates/non-duplicates.
Languages
The dataset language is English (BCP-47 en)
Citation Information
@inproceedings{dedup2020,
title={Deduplication of Scholarly Documents using Locality Sensitive Hashing and Word Embeddings},
author={Gyawali, Bikash and Anastasiou, Lucas and… See the full description on the dataset page: https://huggingface.co/datasets/pinecone/core-2020-05-10-deduplication.sec-10k-qa-embeddings
SEC 10-K QA Embeddings
Pre-computed embeddings for the Tim-Pinecone/sec-10k-qa dataset.
What's in here
Each config is a parquet file containing pre-computed text-embedding-ada-002 embeddings
for a specific chunking strategy applied to the SEC 10-K corpus.
Config
Description
questions_ada002
All 950 evaluation questions
chunks_RecursiveChunker_512_ada002
RecursiveChunker at chunk_size=512
chunks_RecursiveChunker_1024_ada002
RecursiveChunker at… See the full description on the dataset page: https://huggingface.co/datasets/Tim-Pinecone/sec-10k-qa-embeddings.reddit-qa
