CoolFace
Modelpublic

enjalot/sae-all-MiniLM-L6-v2-FineWeb-RedPajama-Pile-150M

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes
Model Card

SAE for all-MiniLM-L6-v2 (FineWeb + RedPajama + Pile, 150M)

Sparse Autoencoder trained on sentence embeddings from all-MiniLM-L6-v2, decomposing 384-dimensional dense embeddings into sparse, interpretable features.

Available Models

SubfolderkExpansionFeaturesActiveFVUDead %Best for
128_41284x1,53626.2%0.09773.8%Best fine-grained accuracy, most distinct features
128_81288x3,07223.4%0.06976.6%Best reconstruction, retrieval
64_8648x3,07298.8%0.1561.2%Maximum feature coverage

Recommended: `128_4` — only 402 active features but best accuracy on hard tasks (CLINC150 79.6%, BANKING77 86.5%), most distinct features (MMCS 0.193), and half the parameters. Best balance of quality and efficiency.

Quick Start

python
from latentsae import Sae
from sentence_transformers import SentenceTransformer

# Load SAE
sae = Sae.load_from_hub("enjalot/sae-all-MiniLM-L6-v2-FineWeb-RedPajama-Pile-150M", "64_8")

# Embed text
emb_model = SentenceTransformer("sentence-transformers/all-MiniLM-L6-v2")
embeddings = emb_model.encode(["Your text here"], normalize_embeddings=True)

# Extract sparse features
import torch
features = sae.encode(torch.tensor(embeddings))
print(f"Top feature indices: {features.top_indices}")
print(f"Top feature activations: {features.top_acts}")

Training Details

  • —Embedding model: sentence-transformers/all-MiniLM-L6-v2 (384D)
  • —Training data: 150M embeddings (50M each):
  • —FineWeb-edu 10BT sample (120-token chunks)
  • —RedPajama-Data-V2 10B sample (120-token chunks)
  • —Pile uncopyrighted (120-token chunks)
  • —Architecture: TopK SAE, k=64, 8x expansion (3,072 features), 2.4M parameters
  • —Training: auxkalpha=1/32, deadfeature_threshold=50K, cosine LR schedule
  • —Hardware: A10G on Modal, 54 minutes, ~$1

Evaluation (Probe Accuracy)

Linear probes on SAE sparse features vs raw embeddings:

TaskRaw`128_4`Gap`128_8`Gap`64_8`Gap
AG News (4-class)89.9%88.1%-1.8%89.3%-0.6%89.0%-0.9%
SST-2 (2-class)80.6%78.9%-1.7%80.0%-0.6%80.6%0.0%
BANKING77 (77-class)87.7%86.5%-1.2%85.7%-2.0%85.2%-2.4%
CLINC150 (150-class)84.1%79.6%-4.5%76.4%-7.7%64.6%-19.6%
STS-B (spearman)0.8810.866-0.0150.871-0.0100.860-0.021
SciFact (nDCG@10)0.6450.621-0.0240.626-0.0190.584-0.061

Feature Quality

Metric`128_4``128_8``64_8`
FVU0.0970.0690.156
MMCS (redundancy)0.1930.2320.287
Active features402/1,536719/3,0722,954/3,072
Parameters1.2M2.4M2.4M
Normalized entropy0.8080.7880.835

Part of the latent-* ecosystem