CoolFace
Datasetpublic

FluidInference/JSUT-basic5000

JSUT (Japanese Speech Corpus) - Test Subset A test subset of the JSUT corpus containing 500 Japanese utterances from the basic5000 dataset (BASIC5000_4501-5000). Dataset Structure jsut_ver1.1/ └── basic5000/ ├── wav/ # WAV audio files (500 files, 48kHz) ├── transcript_utf8.txt # Transcriptions └── recording_info.txt # Recording dates File Formats transcript_utf8.txt… See the full description on the dataset page: https://huggingface.co/datasets/FluidInference/JSUT-basic5000.

sourceHugging Faceupdated 6mo agoView on Hugging Face
1likes346downloads
README.md88 linesDownload Raw Back to root
1# JSUT (Japanese Speech Corpus) - Test Subset2 3A test subset of the JSUT corpus containing 500 Japanese utterances from the basic5000 dataset (BASIC5000_4501-5000).4 5## Dataset Description6 7- **Language:** Japanese (ja)8- **Size:** 500 audio clips9- **Format:** WAV audio (48kHz) + text transcription10- **Source:** [JSUT Corpus](https://sites.google.com/site/shinnosuketakamichi/publication/jsut)11- **Subset:** basic5000 (utterances 4501-5000)12- **License:** CC-BY-SA 4.0 (see LICENCE.txt)13 14## Dataset Structure15 16```17jsut_ver1.1/18└── basic5000/19    ├── wav/                  # WAV audio files (500 files, 48kHz)20    ├── transcript_utf8.txt   # Transcriptions21    └── recording_info.txt    # Recording dates22```23 24## File Formats25 26### transcript_utf8.txt27```28BASIC5000_4501:だが、エーアイセンター稼動を快く思わない...29BASIC5000_4502:また、サイコロに姿を変えることもでき...30...31```32 33### recording_info.txt34```35BASIC5000_4501.wav 12/19/201636BASIC5000_4502.wav 12/19/201637...38```39 40## Usage41 42### Loading with Hugging Face Datasets43 44```python45from datasets import load_dataset46 47# Load from local path48dataset = load_dataset("audiofolder", data_dir="jsut_ver1.1/basic5000")49 50# Or after uploading to Hugging Face Hub51dataset = load_dataset("your-username/jsut-basic5000-test")52```53 54### Loading with Python55 56```python57import pandas as pd58 59# Read transcripts60transcripts = {}61with open("jsut_ver1.1/basic5000/transcript_utf8.txt", "r", encoding="utf-8") as f:62    for line in f:63        utt_id, text = line.strip().split(":", 1)64        transcripts[utt_id] = text65 66print(transcripts["BASIC5000_4501"])67```68 69## Citation70 71```bibtex72@article{sonobe2017jsut,73  title={JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis},74  author={Sonobe, Ryosuke and Takamichi, Shinnosuke and Saruwatari, Hiroshi},75  journal={arXiv preprint arXiv:1711.00354},76  year={2017}77}78```79 80## Acknowledgments81 82This dataset is derived from the JSUT corpus created by:83- Ryosuke Sonobe (University of Tokyo)84- Shinnosuke Takamichi (@forthshinji, University of Tokyo)85- Hiroshi Saruwatari (University of Tokyo)86 87The full corpus is available at: https://sites.google.com/site/shinnosuketakamichi/publication/jsut88