CoolFace
Datasetpublic

laion/majestrino-1.00-16xk5-sae-features

Majestrino 1.00 SAE — Feature Audio Samples (16x, k=5) Top-2000 activating audio samples for each feature in the Majestrino 1.00 SAE. Overview Metric Value SAE Architecture 16x expansion, k=5, d_model=768 Total Features 12,288 Alive Features 10,684 Audio per Feature Up to 2,000 highest-activating Audio Format Opus (24 kbps OGG container) Total TAR Files 1069 Source Dataset laion/majestrino-data File Structure Each TAR… See the full description on the dataset page: https://huggingface.co/datasets/laion/majestrino-1.00-16xk5-sae-features.

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes272downloads
Dataset Card

Majestrino 1.00 SAE — Feature Audio Samples (16x, k=5)

Top-2000 activating audio samples for each feature in the Majestrino 1.00 SAE.

Overview

MetricValue
SAE Architecture16x expansion, k=5, d_model=768
Total Features12,288
Alive Features10,684
Audio per FeatureUp to 2,000 highest-activating
Audio FormatOpus (24 kbps OGG container)
Total TAR Files1069
Source Datasetlaion/majestrino-data

File Structure

Each TAR file contains 10 features, named features_XXXXX_YYYYY.tar.

Inside each TAR:

feature_00042/
  metadata.json       # Feature info, annotation, activation scores
  00001991.opus       # Audio file (highest activation)
  00002299.opus       # Audio file (2nd highest)
  ...
feature_00043/
  metadata.json
  ...

metadata.json

json
{
  "feature_id": 42,
  "title": "British Male Narrator",
  "description": "This feature activates on...",
  "bin": 12,
  "bin_name": "Broadcast & Formal Style",
  "consistency": 3,
  "activation_count": 15234,
  "n_audio_files": 2000,
  "activations": [
    {"file": "00001991.opus", "activation": 0.8234, "original_path": "...", "tar_source": "00042"},
    ...
  ]
}

Usage

python
import tarfile, json

# Extract a feature TAR
with tarfile.open("features_00000_00009.tar") as tf:
    tf.extractall("./extracted")

# Read metadata
with open("./extracted/feature_00042/metadata.json") as f:
    meta = json.load(f)

print(f"Feature {meta['feature_id']}: {meta['title']}")
print(f"Top activation: {meta['activations'][0]['activation']:.4f}")

Related