CoolFace
Datasetpublic

RikkaBotan/nyan-jenny-format

Nyan Jenny Format A Japanese text-to-speech (TTS) dataset in Jenny TTS format, derived from the multilingual_toxicity_dataset (Japanese split). Toxic words identified by DeepSeek V3 Pro are replaced with 「にゃん」(nyan) before audio synthesis, producing naturally-sounding speech that masks harmful content. Dataset Summary This dataset was created through the following pipeline: Source data — The Japanese split of textdetox/multilingual_toxicity_dataset (5 k samples:… See the full description on the dataset page: https://huggingface.co/datasets/RikkaBotan/nyan-jenny-format.

sourceHugging Faceopenrail++updated 4mo agoView on Hugging Face
1likes128downloads
../
filetrain-00000-of-00014.parquet476.2 MBdownload
filetrain-00001-of-00014.parquet479.1 MBdownload
filetrain-00002-of-00014.parquet455.7 MBdownload
filetrain-00003-of-00014.parquet476.2 MBdownload
filetrain-00004-of-00014.parquet461.5 MBdownload
filetrain-00005-of-00014.parquet465.0 MBdownload
filetrain-00006-of-00014.parquet485.7 MBdownload
filetrain-00007-of-00014.parquet481.7 MBdownload
filetrain-00008-of-00014.parquet477.9 MBdownload
filetrain-00009-of-00014.parquet474.2 MBdownload
filetrain-00010-of-00014.parquet475.6 MBdownload
filetrain-00011-of-00014.parquet485.5 MBdownload
filetrain-00012-of-00014.parquet477.8 MBdownload
filetrain-00013-of-00014.parquet474.0 MBdownload
filevalidation-00000-of-00001.parquet347.3 MBdownload

RikkaBotan/nyan-jenny-format · main · files are served by the source, never re-hosted here