CoolFace
Datasetpublic

TTS-AGI/podcast-dramabox-dacvae-pairs

podcast-dramabox-dacvae-pairs Paired audio-codec latents for training a DramaBox → DACVAE latent translator. Both codecs share an identical grid: 25 Hz, 128-dim, frame-aligned (same length). Derived from TTS-AGI/podcast-tokenized-bg3.5-enj5. How it was built (per sample) DACVAE latent (from source dataset, = target) → DACVAE.decode → 48 kHz mono wav → duplicate to stereo → DramaBox/LTX-2.3 audio VAE encode → patchify → DramaBox latent (= input). Both latents… See the full description on the dataset page: https://huggingface.co/datasets/TTS-AGI/podcast-dramabox-dacvae-pairs.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes66downloads
file00_00_0000.npz1.22 GBdownload
file00_00_0001.npz1.22 GBdownload
file00_00_0002.npz542.0 MBdownload
file00_00_0003.npz1.21 GBdownload
file00_00_0004.npz1.20 GBdownload
file00_00_0005.npz540.8 MBdownload

TTS-AGI/podcast-dramabox-dacvae-pairs · main · files are served by the source, never re-hosted here