bge-reranker
default-680K-bge-reranker-v2-gemmabge-reranker-dataThe dataset used to train bge-reranker-large and bge-reranker-base.
You can find the fine-tuning script in FlagEmbedding
Citation
If you find this repository useful, please consider giving a star :star: and citation
@misc{bge_embedding,
title={C-Pack: Packaged Resources To Advance General Chinese Embedding},
author={Shitao Xiao and Zheng Liu and Peitian Zhang and Niklas Muennighoff},
year={2023},
eprint={2309.07597},
archivePrefix={arXiv}… See the full description on the dataset page: https://huggingface.co/datasets/Shitao/bge-reranker-data.bge-reranker-qwen3-embedding
bge-reranker → Qwen3-Embedding (0.6B) embedding dataset
Precomputed Qwen3-Embedding-0.6B embeddings for the
Shitao/bge-reranker-data
dataset, together with a deduplicated, index-based reranking layout
(anchor / positive / negative triples) suitable for training a metric-learning
projection head.
The point of this dataset: rank documents with a dot product against cached
vectors — no cross-encoder, no re-reading documents at query time.
What's inside
combined/… See the full description on the dataset page: https://huggingface.co/datasets/npc0/bge-reranker-qwen3-embedding.msmarco-bge-reranker-v2-m3-7hn-temperature2-softmaxmsmarco-bge-reranker-v2-m3-7hn-rawnq-bge-reranker-v2-m3-7hn-temperature4-softmax
