memo-ozdincer/jepa-qwen3-32b-pure-baselines-2026-05-25
JEPA-Align: Qwen3-32B Safety Defense Matrix The complete 11-condition Qwen3-32B experiment for Predictive Representation Alignment (PRA), the paired-view objective introduced in Predictive Representation Alignment Improves Generalization in LLM Safety. PRA aligns adversarially rewritten prompts with clean prompts expressing the same intent. This release contains trained adapters, attack traces, benign capability evaluations, machine-readable results, and paper-ready tables for… See the full description on the dataset page: https://huggingface.co/datasets/memo-ozdincer/jepa-qwen3-32b-pure-baselines-2026-05-25.
Polish public dataset card
Wang strict (arXiv 2509.03888) Table 1: PRA+proj scores 91.5% HarmBench / 94.0% AdvBench OOD acc
Wang probe v2: add MultiJail axis + 8B PRA companion (plain + proj)
Add Wang et al. 'Why Probing Fails' protocol on q_base/q_ce/q_cb
Remove per_cell_summary/ (replaced by consolidated_results)
Remove superseded results_summary.json
Remove superseded submission_manifest.json
Remove superseded jobs.jsonl
Remove superseded PROGRESS.md
Remove superseded INDEX.md
Remove superseded EXPERIMENT_README.md
Add cell q_cb_pra_id_jepa
Add cell q_cb_pra_jepa
Add cell q_ce_pra_id_jepa
Add cell q_ce_pra_jepa
Add cell q_cb_pra_id
Add cell q_cb_pra
Add cell q_ce_pra_id
Add cell q_ce_pra
Add cell q_base
Consolidate 11-cell matrix: master README + RESULTS + LaTeX snippets + integration guide
Remove superseded paper_snippets/pure_baselines.bib
Remove superseded paper_snippets/pure_baselines_combined.tex
Remove superseded paper_snippets/pure_baselines_mmlu.tex
Remove superseded paper_snippets/pure_baselines_asr.tex
Remove superseded paper_snippets/pure_baselines_macros.tex
Add dataset card + paper_snippets (LaTeX tables, macros, bibtex)
Pure-defense baselines (q_ce, q_cb, w_jepa=0) + 4 benchmarks
initial commit
