WariHima/wav2phone-dataset
jvnv-nonvデータセットの話者f2で学習したVoiceSpeechMakerのモデルで、jsutコーパスの書き下し分を推論し、推論時のフルコンテキストラベルとペアにしたデータセットです フルコンテキストラベルは次のような形式です(hfのプレビューは壊れています) xx^xx-sil+m=i/A:xx+xx+xx/B:xx-xx_xx/C:xx_xx+xx/D:02+xx_xx/E:xx_xx!xx_xx-xx/F:xx_xx#xx_xx@xx_xx|xx_xx/G:3_3%0_0_xx/H:xx_xx/I:xx-xx@xx+xx&xx-xx|xx+xx/J:3_23/K:1+3-23 xx^sil-m+i=z/A:-2+1+3/B:xx-xx_xx/C:02_xx+xx/D:13+xx_xx/E:xx_xx!xx_xx-xx/F:3_3#0_0@1_3|1_23/G:7_2%0_0_1/H:xx_xx/I:3-23@1+1&1-3|1+23/J:xx_xx/K:1+3-23… See the full description on the dataset page: https://huggingface.co/datasets/WariHima/wav2phone-dataset.
25
Update README.md
Update README.md
Upload 7 files
initial commit
