CoolFace
Datasetpublic

FluidInference/JSUT-basic5000

JSUT (Japanese Speech Corpus) - Test Subset A test subset of the JSUT corpus containing 500 Japanese utterances from the basic5000 dataset (BASIC5000_4501-5000). Dataset Structure jsut_ver1.1/ └── basic5000/ ├── wav/ # WAV audio files (500 files, 48kHz) ├── transcript_utf8.txt # Transcriptions └── recording_info.txt # Recording dates File Formats transcript_utf8.txt… See the full description on the dataset page: https://huggingface.co/datasets/FluidInference/JSUT-basic5000.

sourceHugging Faceupdated 6mo agoView on Hugging Face
1likes355downloads
README_ja.txt44 linesDownload Raw Back to root
1JSUT (Japanese speech corpus of Saruwatari Lab, University of Tokyo) corpus2 3==== 内容 ==== 4 このコーパスは日本語テキストと読み上げ音声からなります.音声データは48kHzでサンプリングされ,無響室で収録されました.一人の日本語女性話者の音声を収録しました.このコーパスは,10時間 を含み,以下のデータからなります. 5   - basic5000 ... 常用漢字の音読み・訓読みを全てカバー6   - utparaphrase512 ... 文の一部を読み替えたもの7   - onomatopee300 ... 日本語オノマトペ8   - countersuffix26 ... 数詞9   - loanword128 ... 外来語由来の動詞・名詞 (e.g., ググる)10   - voiceactress100 ... 声優統計コーパス (プロ女性声優のフリーコーパス) とのパラ音声11   - travel1000 ... 旅行ドメインのフレーズ12   - precedent130 ... 判例文13   - repeat500 ... 繰り返し発話された音声 (100文 * 5回)14 15 各ディレクトリには,以下のものが入っています. 16   - /wav/ ... 音声データ17   - /transcript_utf8.txt ... テキストデータ18   - /recording_info.txt ... いつ音声を収録したか (MM/DD/YYYY)  19   - /memo.txt ... アノテータのコメント20   21==== 使い方 ==== 22 テキストデータは,CC-BY-SA 4.0などにてライセンスされております.詳細は,LICENCEファイルをご覧ください.音声データは,以下の場合に限り使用可能です.23   - アカデミック機関での研究24   - 非商用目的の研究(営利団体での研究も含む)25   - 個人での利用(ブログなどを含む)26営利目的の利用を希望される場合,私 (@forthshinji or email) まで連絡して下さい.この音声データの再配布は認められていませんが,あなたのウェブページやブログなどでコーパスの一部(例えば,100文程度)を公開することは可能です.できれば,あなたが論文やブログポスト等の成果を公開した際には,私まで連絡してもらえると助かります.このコーパスの貢献を調査することは,我々にとって非常に有効な情報となります.27 28==== 作成者 ==== 29 園部 良介 (東京大学) 30 高道 慎之介 (東京大学)31 猿渡 洋 (東京大学)32 33高道 慎之介 (shinnosuke_takamichi@ipc.i.u-tokyo.ac.jp) が主な責任者です.34 35==== 商用利用 ====36我々は,皆様の商用利用を歓迎します.下記メールアドレスにご連絡ください.37居石 圭司 (東大TLO): sueishi [_at_mark_] todaitlo.jp38高道 慎之介: shinnosuke_takamichi [_at_mark_] ipc.i.u-tokyo.ac.jp39 40==== 引用 ====41Ryosuke Sonobe, Shinnosuke Takamichi and Hiroshi Saruwatari, 42"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis,"43arXiv preprint, 1711.00354, 2017.44