CoolFace
Modelpublic

kandinskylab/KVAE-Audio

sourceHugging Facemitupdated 1mo agoView on Hugging Face
58likes66downloads
Model Card

<div align="center"> <picture> <img src="assets/kvae_audio.png"> </picture>

<a href="https://github.com/kandinskylab/kvae-audio">GitHub</a> | <a href="https://habr.com/ru/companies/sberbank/articles/1053410/">Habr article</a> | <a href="https://kandinskylab.ai/">Project Page</a> | <a href="https://huggingface.co/papers/2608.05798">Technical Report</a> </div>

<h1>KVAE-Audio</h1>

KVAE-Audio is a continuous, full-band (48 kHz) audio autoencoder. It compresses raw waveforms into compact continuous latents and reconstructs them with high fidelity across speech, music, and general sound. The model is designed not only for faithful reconstruction, but as a latent space for generative models — in our internal text-to-audio pipeline, swapping the autoencoder for KVAE-Audio improves generation quality under a fixed generator.

Evaluation results

Evaluation of latent space qualities for generation

Generative quality is established under a fixed generator — same DiT architecture, training data, and number of steps — varying only the autoencoder. We report objective generation metrics and blind human side-by-side below.

<img src="assets/sbssamel.png" />

<img src="assets/sbs_moviegen.png" />

<img src="assets/sbs_mmaudio.png" />

AudioCaps test set

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓
MMAudio 44.1kHz427.6M400,3363,9096,19217,873195,9101,364
DACVAE MovieGen107.7M1280,3133,7726,16720,558234,3121,700
SAME-L852.1M2560,3223,5885,75618,446240,6351,325
KVAE-Audio166.9M640,3443,9826,24215,381193,7601,210
Song Describer
Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓
MMAudio 44.1kHz427.6M400,3567,1367,7075,412158,5990,356
DACVAE MovieGen107.7M1280,3126,9537,53810,194214,0091,046
SAME-L852.1M2560,3457,0767,4658,442250,6680,987
KVAE-Audio166.9M640,3397,2167,9297,971189,4270,599
LibriSpeech test-clean
Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓WER↓CER↓
MMAudio 44.1kHz427.6M400,3685,7046,6298,305105,9312,0010,2570,593
DACVAE MovieGen107.7M1280,4135,4827,0525,008210,4781,5010,9111,048
SAME-L852.1M2560,3794,6175,02410,257301,5082,7210,3490,629
KVAE-Audio166.9M640,3895,9066,9404,677185,6092,1380,2440,576

Reconstructions

Reconstruction is evaluated on open datasets across domains (the released weights directly substantiate these numbers). Baselines: [MMAudio 44.1 kHz](https://arxiv.org/abs/2412.15322) VAE, [DACVAE from MovieGen Audio](https://arxiv.org/abs/2410.13720), [SAME-L](https://arxiv.org/abs/2605.18613) (Stable Audio 3 VAE).

AudioSet eval
Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑
MMAudio 44.1kHz427.6M400,6361,9380,106-32,080-2,682-2,686
DACVAE MovieGen107.7M1280,6692,2750,0298,3849,4219,416
SAME-L852.1M2560,9862,7260,0279,58610,34710,339
KVAE-Audio166.9M640,5371,7700,0279,0659,9209,933
MUSDB18-HQ
Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑
MMAudio 44.1kHz427.6M400,6811,8650,114-40,204-3,274-3,273
DACVAE MovieGen107.7M1280,5191,7620,0249,68810,04610,047
SAME-L852.1M2560,6681,7860,02310,27810,64810,648
KVAE-Audio166.9M640,5161,7250,02210,39010,67510,677
EARS
Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑PESQ↑
MMAudio 44.1kHz427.6M400,6161,3950,030-29,947-2,728-2,6972,424
DACVAE MovieGen107.7M1280,4531,3100,00610,26410,68010,6814,246
SAME-L852.1M2560,7741,5750,0079,93910,37410,3762,982
KVAE-Audio166.9M640,4631,3140,0069,95210,37710,3844,266