CoolFace
20 results

pinecone

pinecone /msmarco-beir-e50 likes7.5k downloads1y agoHugging Facepinecone /msmarco-beir-constbert0 likes2.3k downloads1y agoHugging Faceedanigoben /pinecone_test Dataset Card for "pinecone_test" More Information needed text1M<n<10M0 likes300 downloads3y agoHugging Facepinecone /core-2020-05-10-deduplication Dataset Card for CORE Deduplication Dataset Summary CORE 2020 Deduplication dataset (https://core.ac.uk/documentation/dataset) contains 100K scholarly documents labeled as duplicates/non-duplicates. Languages The dataset language is English (BCP-47 en) Citation Information @inproceedings{dedup2020, title={Deduplication of Scholarly Documents using Locality Sensitive Hashing and Word Embeddings}, author={Gyawali, Bikash and Anastasiou, Lucas and… See the full description on the dataset page: https://huggingface.co/datasets/pinecone/core-2020-05-10-deduplication.textother100K<n<1M1 likes198 downloads4y agoHugging FaceTim-Pinecone /sec-10k-qa-embeddings SEC 10-K QA Embeddings Pre-computed embeddings for the Tim-Pinecone/sec-10k-qa dataset. What's in here Each config is a parquet file containing pre-computed text-embedding-ada-002 embeddings for a specific chunking strategy applied to the SEC 10-K corpus. Config Description questions_ada002 All 950 evaluation questions chunks_RecursiveChunker_512_ada002 RecursiveChunker at chunk_size=512 chunks_RecursiveChunker_1024_ada002 RecursiveChunker at… See the full description on the dataset page: https://huggingface.co/datasets/Tim-Pinecone/sec-10k-qa-embeddings.feature-extraction0 likes100 downloads6mo agoHugging Facepinecone /reddit-qatext1K<n<10K3 likes87 downloads4y agoHugging Face