CoolFace
Datasetpublic

Elite35P-Server/EliteVoiceProject

Elite Voice Project これはホロライブ所属Vtuberさくらみこ氏の声をデータセット化し音声認識などで活用できるようにする事を目的とした非公式プロジェクトです。 LICENSEについて データセット内の音声データ すべてのデータは、hololive productionの二次創作ガイドラインに準拠する形で利用されています。 これらのデータの著作権はカバー株式会社等が保有しており、リポジトリオーナー、コントリビューターは一切の権利を有しておりません。 当プロジェクトへのご協力 当プロジェクトは皆様のご協力を心より歓迎いたします。 以下の方法をご一読いただき、そのうえでプルリクエストをお願い致します。 始める前に hololive productionの二次創作ガイドラインを必ずお読みください。 音声データの追加… See the full description on the dataset page: https://huggingface.co/datasets/Elite35P-Server/EliteVoiceProject.

sourceHugging Faceotherupdated 4y agoView on Hugging Face
13likes230downloads
Dataset Card

Elite Voice Project

これはホロライブ所属Vtuberさくらみこ氏の声をデータセット化し音声認識などで活用できるようにする事を目的とした非公式プロジェクトです。


LICENSEについて

データセット内の音声データ

すべてのデータは、hololive productionの二次創作ガイドラインに準拠する形で利用されています。

これらのデータの著作権はカバー株式会社等が保有しており、リポジトリオーナー、コントリビューターは一切の権利を有しておりません。


当プロジェクトへのご協力

当プロジェクトは皆様のご協力を心より歓迎いたします。 以下の方法をご一読いただき、そのうえでプルリクエストをお願い致します。

始める前に

hololive productionの二次創作ガイドラインを必ずお読みください。


音声データの追加

基本的には、データセットに追加したい音声データをaudio_rawディレクトリ内の所定のディレクトリへ追加していただく形になります。

git等を使用して音声データを追加する場合にはgit-lfsが必要になります。事前にgit-lfsのインストールをお願い致します。

audio_rawディレクトリ内の構造は以下の通りです。

audio_raw
├─twitch
│  ├─test
│  │  └─<ID>
│  │     ├─1.mp3
│  │     ├─2.mp3
│  │     ├─3.mp3
│  │     ├─.
│  │     └─.
│  └─train
│     └─<ID>
│        ├─1.mp3
│        ├─2.mp3
│        ├─3.mp3
│        ├─.
│        └─.
├─twitter
│  ├─test
│  │  └─<ID>
│  │     ├─1.mp3
│  │     ├─2.mp3
│  │     ├─3.mp3
│  │     ├─.
│  │     └─.
│  └─train
│     └─<ID>
│        ├─1.mp3
│        ├─2.mp3
│        ├─3.mp3
│        ├─.
│        └─.
└─youtube
   ├─test
   │  └─<ID>
   │     ├─1.mp3
   │     ├─2.mp3
   │     ├─3.mp3
   │     ├─.
   │     └─.
   └─train
      └─<ID>
         ├─1.mp3
         ├─2.mp3
         ├─3.mp3
         ├─.
         └─.
  • —youtube, twitch, twitchディレクトリはデータセットに追加するデータの切り出し元のプラットフォーム名です。
  • —trainとtestディレクトリについてですが、OpenAI Whisper等の学習を行う際にtrainとtest、2種類のデータが必要になるために存在しています。
  • —trainとtestには同じ配信から切り出したデータを入れても良いですが全く同じデータを入れることは辞めてください。正確に学習を行うことができなくなります。
  • —<ID>には音声データを切り出す元になった配信等のIDが入ります。
  • —YouTubeであればhttps://www.youtube.com/watch?v=X9zw0QF12KcのX9zw0QF12Kcがディレクトリ名となります。
  • —Twitterであればhttps://twitter.com/i/spaces/1lPKqmyQPOAKbの1lPKqmyQPOAKbがディレクトリ名となります。
  • —Twitchであればhttps://www.twitch.tv/videos/824387510の824387510がディレクトリ名となります。
  • —<ID>ディレクトリ内には連番でmp3形式の音声ファイルを入れてください。
  • —音声データは30秒以内である必要があります。
  • —BGMやSE、ノイズ等が含まれる音声データは避けてください。
  • —あまりに短すぎる音声データは避けてください。(既にデータセットにある音声は削除予定です。)
  • —出来る限り30秒に近い音声データを入れていただけると助かります。
  • —文脈のある音声データが望ましいです。
  • —英語の音声は避けてください。

書き起こしテキストデータの追加

基本的には、データセットに追加したい音声データの書き起こしテキストデータをtranscript_rawディレクトリ内の所定のディレクトリへ追加していただく形になります。

transcript_rawディレクトリ内の構造は以下の通りです。

transcript_raw
├─twitch
│  ├─test
│  │  └─<ID>.csv 
│  │
│  └─train
│     └─<ID>.csv
│
├─twitter
│  ├─test
│  │  └─<ID>.csv 
│  │
│  └─train
│     └─<ID>.csv
│
└─youtube
   ├─test
   │  └─<ID>.csv
   │
   └─train
      └─<ID>.csv
  • —youtube, twitch, twitchディレクトリはデータセットに追加するデータの切り出し元のプラットフォーム名です。
  • —<ID>には音声データを切り出す元になった配信等のIDが入ります。
  • —YouTubeであればhttps://www.youtube.com/watch?v=X9zw0QF12KcのX9zw0QF12Kcがディレクトリ名となります。
  • —Twitterであればhttps://twitter.com/i/spaces/1lPKqmyQPOAKbの1lPKqmyQPOAKbがディレクトリ名となります。
  • —Twitchであればhttps://www.twitch.tv/videos/824387510の824387510がディレクトリ名となります。
  • —<ID>.csvについて
  • —必ずaudio_rawに追加した音声データに対応した書き起こしテキストを追加する必要があります。
  • —句読点、!,?等は正確に入れてください。
  • —半角英数字記号を使用してください。(!, ?, 1等)
  • —漢数字は避けてください。
  • —csvファイルの1行目は必ずpath,sentenceで始めてください。
  • —書き起こしテキストはWhisper等で一度書き起こしたものを修正して行く方法を推奨致します。

CSVファイルの記述例

csv
path,sentence
1.mp3,雷が落ちた時のみこ
2.mp3,コメント止まった?
3.mp3,見えてるー?いやコメント止まった。壊れた。
4.mp3,インターネット繋がってない!
5.mp3,雷鳴ったよまた