CoolFace
Datasetpublic

WariHima/wav2phone-dataset

jvnv-nonvデータセットの話者f2で学習したVoiceSpeechMakerのモデルで、jsutコーパスの書き下し分を推論し、推論時のフルコンテキストラベルとペアにしたデータセットです フルコンテキストラベルは次のような形式です(hfのプレビューは壊れています) xx^xx-sil+m=i/A:xx+xx+xx/B:xx-xx_xx/C:xx_xx+xx/D:02+xx_xx/E:xx_xx!xx_xx-xx/F:xx_xx#xx_xx@xx_xx|xx_xx/G:3_3%0_0_xx/H:xx_xx/I:xx-xx@xx+xx&xx-xx|xx+xx/J:3_23/K:1+3-23 xx^sil-m+i=z/A:-2+1+3/B:xx-xx_xx/C:02_xx+xx/D:13+xx_xx/E:xx_xx!xx_xx-xx/F:3_3#0_0@1_3|1_23/G:7_2%0_0_1/H:xx_xx/I:3-23@1+1&1-3|1+23/J:xx_xx/K:1+3-23… See the full description on the dataset page: https://huggingface.co/datasets/WariHima/wav2phone-dataset.

sourceHugging Facemitupdated 1y agoView on Hugging Face
2likes5downloads
4 commits on main
8d319011y ago

Update README.md

WariHima
e73fc351y ago

Update README.md

WariHima
64953ed1y ago

Upload 7 files

WariHima
5c6e80d1y ago

initial commit

WariHima