Azuremis/mlx7-two-tower-data
mlx7-two-tower-data This repository contains datasets used for training Two-Tower (Dual Encoder) models for document retrieval. Dataset Description The datasets provided here are structured for training dual encoder models with various sampling strategies: classic_triplets: 48.2 MB intra_query_neg: 47.6 MB multi_pos_multi_neg: 126.5 MB Dataset Details classic_triplets.parquet: Standard triplet format with (query, positive_document… See the full description on the dataset page: https://huggingface.co/datasets/Azuremis/mlx7-two-tower-data.
Add dataset multi_pos_multi_neg.parquet
Add dataset intra_query_neg.parquet
Add dataset classic_triplets.parquet
Add dataset metadata
Add dataset card
initial commit
