efficientrag
efficientrag-filter-training-data
EfficientRAG Filter Training Data
Training data for the Filter component of EfficientRAG.
Format
JSONL with fields:
query_info — concatenation of original question + extracted useful tokens
token_labels — per-word binary labels (1=keep, 0=discard)
Statistics
Count
Total samples
5,691
Data Sources
Source
Language
Samples
Method
HotpotQA (5K questions)
EN
~5K
Heuristic labels
Dragon-derec multi-hop (690)
RU
~700… See the full description on the dataset page: https://huggingface.co/datasets/Necent/efficientrag-filter-training-data.efficientrag-labeler-training-data
EfficientRAG Labeler Training Data
Training data for the Labeler component of EfficientRAG.
Format
JSONL with fields:
question — query text
chunk — retrieved passage text
token_labels — per-word binary labels (1=useful, 0=useless)
tag — <CONTINUE>, <FINISH>, or <TERMINATE>
Statistics
Count
Total samples
30,818
CONTINUE
positive multi-hop chunks
FINISH
single-hop answer chunks
TERMINATE
hard negatives
Data Sources
Source… See the full description on the dataset page: https://huggingface.co/datasets/Necent/efficientrag-labeler-training-data.
