CoolFace
Datasetpublic

TTS-AGI/commonvoice22-sidon-dacvae

CommonVoice 22 (Sidon-enhanced) converted to DAC VAE latents Source sarulab-speech/commonvoice22_sidon Format Each tar shard (~2GB) contains samples with three files per sample: {sample_key}.audio.flac # Original audio (FLAC, original sample rate) {sample_key}.dacvae.npy # DAC VAE latent [T_latent, 128] numpy float32 {sample_key}.metadata.json # All metadata + duration_seconds + chars_per_second DAC VAE Latent Format… See the full description on the dataset page: https://huggingface.co/datasets/TTS-AGI/commonvoice22-sidon-dacvae.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
1likes924downloads
Dataset Card

CommonVoice 22 (Sidon-enhanced) converted to DAC VAE latents

Source

sarulab-speech/commonvoice22_sidon

Format

Each tar shard (~2GB) contains samples with three files per sample:

{sample_key}.audio.flac       # Original audio (FLAC, original sample rate)
{sample_key}.dacvae.npy       # DAC VAE latent [T_latent, 128] numpy float32
{sample_key}.metadata.json    # All metadata + duration_seconds + chars_per_second

DAC VAE Latent Format

  • Model: mrfakename/dacvae-watermarked (Facebook DACVAE)
  • Input sample rate: 48,000 Hz (audio resampled before encoding)
  • Latent shape: [T_latent, 128] where T_latent = ceil(audio_samples / 1920)
  • Latent rate: 25 frames/second
  • Storage: numpy float32

Shard Naming

{LANG}-{split}-{index:05d}.tar (e.g., EN-train-00000.tar, DE-train-00001.tar)

Loading

With WebDataset

python
import webdataset as wds
import numpy as np
import json
import soundfile as sf
import io

url = "https://huggingface.co/datasets/TTS-AGI/commonvoice22-sidon-dacvae/resolve/main/EN-train-00000.tar"
dataset = wds.WebDataset(url).decode()

for sample in dataset:
    audio_bytes = sample["audio.flac"]
    latent = np.load(io.BytesIO(sample["dacvae.npy"]))  # [T, 128]
    meta = json.loads(sample["metadata.json"])
    print(f"Text: {meta['text']}, Duration: {meta['duration_seconds']}s, CPS: {meta['chars_per_second']}")

Decoding Latents Back to Audio

python
from dacvae import DACVAE
from huggingface_hub import hf_hub_download
import torch, numpy as np

model = DACVAE.load(hf_hub_download("mrfakename/dacvae-watermarked", "weights.pth")).cuda().eval()
latent = np.load("sample.dacvae.npy")  # [T_latent, 128]
z = torch.from_numpy(latent.T).unsqueeze(0).cuda()  # [1, 128, T_latent]
audio_48k = model.decode(z).squeeze(0).cpu()  # [1, T_audio] at 48kHz

Current Status

Shards uploaded: 935

Progress by Language

LanguageSamples
AB_train21,037
AF_train139
AM_train523
AR_train28,531
AS_train1,386
AZ_train157
BA_train121,197
BE_train347,672
BG_train4,952
BN_train21,514
BR_train3,510
CA_train1,158,926
CK_train7,878
CN_train818
CS_train21,731
CV_train1,456
CY_train8,014
DA_train5,699
DE_train607,871
DY_train88
EL_train1,934
EN_train1,138,759
EO_train128,103
ES_train353,699
ET_train3,402
EU_train130,043
FA_train29,789
FI_train2,093
FR_train593,066
FY_train3,924
GA_train546
GL_train70,039
GN_train1,641
HA_train1,908
HE_train1,011
HI_train4,869
HS_train809
HT_train11
HU_train39,270
HY_train9,302
IA_train4,909
ID_train4,973
IG_train9
IS_train17
IT_train172,828
JA_train15,425
KA_train215,015
KK_train605
KL_train11,064
KO_train519
KY_train1,790
LG_train64,144
LI_train2,304
LO_train98
LT_train12,895
LU_train4,498
LV_train4,410
MD_train175
MH_train186,565
MK_train2,049
ML_train1,235
MN_train2,193
MR_train16,514
MT_train1,910
MY_train1,241
NA_train11,608
NB_train227
NE_train353
NH_train23
NL_train43,458
NN_train464
NS_train2
OC_train304
OR_train2,151
OS_train414
PA_train800
PL_train24,173
PS_train4,611
PT_train22,923
QU_train26
RM_train2,148
RO_train5,178
RU_train26,654
RW_train1,003,029
SA_train2,528
SC_train925
SD_train271
SK_train8,910
SL_train1,469
SQ_train2,658
SR_train2,336
SV_train8,150
SW_train46,534
TA_train46,390
TE_train69
TG_train123
TH_train32,959
TI_train2,010
TK_train741
TN_train1,078
TO_train2,630
TR_train40,377
TT_train8,871
TW_train205
UG_train107,646
UK_train26,773
UR_train7,326
UZ_train48,733
VI_train2,104
VO_train96
XH_train7
YI_train320
YO_train1,404
YU_train7,419
ZG_train842
ZH_train45,246
ZU_train12
ZZ_train734

Metadata Fields

Each metadata.json contains:

  • dataset: Source dataset name
  • language: Language code
  • split: Data split (train/dev/test)
  • sample_id: Original sample identifier
  • text: Transcript
  • duration_seconds: Audio duration in seconds
  • chars_per_second: Text characters per second of audio
  • original_sample_rate: Original audio sample rate
  • dacvae_sample_rate: 48000 (DAC VAE input rate)
  • latent_frames: Number of latent time frames
  • Plus all original dataset-specific fields

Generated with Claude Code