mschonhardt/ETP-Eval26-embeddings
ETP-Eval26 Embeddings Vorberechnete Vektoren zum Datensatz ETP-Eval26. Inhalt Eine .npz-Datei je Modell, dazu meta.json mit den Zeilenbeschriftungen. Datei Modell Dimension bge-m3.npz BAAI/bge-m3 1024 mE5-large.npz intfloat/multilingual-e5-large 1024 labse.npz sentence-transformers/LaBSE 768 sphilberta.npz bowphs/SPhilBerta 768 qwen3-emb-0.6b.npz Qwen/Qwen3-Embedding-0.6B 1024 qwen3-emb-4b.npz Qwen/Qwen3-Embedding-4B 2560 xlmr.npz… See the full description on the dataset page: https://huggingface.co/datasets/mschonhardt/ETP-Eval26-embeddings.
ETP-Eval26 Embeddings
Vorberechnete Vektoren zum Datensatz ETP-Eval26.
Inhalt
Eine .npz-Datei je Modell, dazu meta.json mit den Zeilenbeschriftungen.
Jede Datei enthält vier Arrays in float32:
Alle Vektoren sind L2-normalisiert.
meta.json hält die Zuordnung der Zeilen fest: doc_ids gibt die Reihenfolge der 2.051 Korpuszeilen, queries beschreibt die 24.654 Anfragezeilen mit qid, style, query_lang, persona und target. Der Anfragetext selbst steht dort nicht — er kommt aus ETP-Eval26.
Die Reihenfolge entspricht exakt der, die encode.py aus master.jsonl erzeugt: Korpuszeilen in Dateireihenfolge, Anfragen in der Reihenfolge ihres Auftretens je Dokument. Wer eigene Vektoren dazustellt, muss diese Reihenfolge einhalten.
Verwendung
import json
import numpy as np
from huggingface_hub import hf_hub_download
REPO = 'mschonhardt/ETP-Eval26-embeddings'
meta = json.load(open(hf_hub_download(REPO, 'meta.json', repo_type='dataset')))
d = np.load(hf_hub_download(REPO, 'bge-m3-ft.npz', repo_type='dataset'))
sim = d['queries'] @ d['corpus_la'].T # Kosinus, da normalisiert
top = sim.argmax(axis=1)
pos = {u: i for i, u in enumerate(meta['doc_ids'])}
gold = np.array([pos[q['target']] for q in meta['queries']])
print('Accuracy@1:', (top == gold).mean())Verwandte Ressourcen
- Datensatz: ETP-Eval26
- Nachtrainierte Modelle: etp-bgem3, etp-canonberta, etp-xlmr, etp-qwen0.6b, etp-qwen4b
- Domänenadaptiertes Backbone: CanonBerta-v1
Lizenz
CC BY 4.0, wie der zugrundeliegende Datensatz. Die Vektoren sind abgeleitete Repräsentationen gemeinfreier Quellentexte; für die Modelle selbst gilt jeweils deren eigene Lizenz.
