datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
gpt-oss-120b-mandarin-thinking-eval-logs-and-scoresgemma-3-taide-12b-chat-eval-logs-and-scoresNVIDIA-Nemotron-3-Super-120B-A12B-FP8-eval-logs-and-scoresministral-14b-eval-logs-and-scoresgemma-3-4b-it-eval-logs-and-scoresgpt-oss-20b-mandarin-thinking-eval-logs-and-scoresLlama-Breeze2-8B-Instruct-eval-logs-and-scoresnemotron-nano-eval-logs-and-scoresgemma-3-4B-T1-it-eval-logs-and-scoresdevstral-eval-logs-and-scoresllama-3.2-3B-f1-instruct-eval-logs-and-scoresLlama-3.1-8B-Instruct-eval-logs-and-scoresLlama-3.3-70B-Instruct-eval-logs-and-scoresGemma-3-12b-it-eval-logs-and-scoresphi-4-eval-logs-and-scoresLlama-3-Taiwan-70B-Instruct-eval-logs-and-scoresLlama-3.2-3B-Instruct-eval-logs-and-scoresLlama-3.1-Taiwan-8B-Instruct-eval-logs-and-scoresDevstral-Small-2505-eval-logs-and-scoresgemma-3-27b-it-eval-logs-and-scoresmistral-675b-eval-logs-and-scorestwin-uniref50-faiss
Twin-Model UniRef50 FAISS Index
FAISS index over Twin model mean-pooled embeddings of all UniRef50
representative proteins (~49.8M). The Twin model is a two-tower contrastive
encoder fine-tuned on Resnik GO similarity:
Custom tower: AA-vocab Transformer → padding-masked mean pool → MLP → 512-dim
ESM tower: facebook/esm2_t33_650M_UR50D (frozen) → masked mean pool → MLP → 512-dim
Output: concat(custom, esm) → 1024-dim
Checkpoint:… See the full description on the dataset page: https://huggingface.co/datasets/genomenet/twin-uniref50-faiss.
