CoolFace
Datasetpublic

hhim8826/japanese-anime-speech-v2-split-150k

japanese-anime-speech-v2-split-150k joujiboi/japanese-anime-speech-v2 的 150,000 筆隨機子集,已切好 train / test。 split rows train 135,000 test 15,000 total 150,000 Columns audio — 16 kHz mp3,與原始資料完全相同(未重新編碼) sentence — 轉錄文字(原始欄位名為 transcription) How it was built 來源的 sfw(271,788 筆)與 nsfw(20,849 筆)兩個 split 都有使用,並依原始比例分配名額 (sfw 139,313 / nsfw 10,687)。 在每個 split 的全部列上做無放回均勻抽樣,因此每筆資料被選中的機率相同。 抽出後整體打亂,前 15,000 筆為 test,其餘為 train,train / test… See the full description on the dataset page: https://huggingface.co/datasets/hhim8826/japanese-anime-speech-v2-split-150k.

sourceHugging Facegplupdated 2mo agoView on Hugging Face
0likes194downloads
Dataset Card

japanese-anime-speech-v2-split-150k

`joujiboi/japanese-anime-speech-v2` 的 150,000 筆隨機子集,已切好 train / test。

splitrows
train135,000
test15,000
total150,000

Columns

  • —audio — 16 kHz mp3,與原始資料完全相同(未重新編碼)
  • —sentence — 轉錄文字(原始欄位名為 transcription)

How it was built

  • —來源的 sfw(271,788 筆)與 nsfw(20,849 筆)兩個 split 都有使用,並依原始比例分配名額 (sfw 139,313 / nsfw 10,687)。
  • —在每個 split 的全部列上做無放回均勻抽樣,因此每筆資料被選中的機率相同。
  • —抽出後整體打亂,前 15,000 筆為 test,其餘為 train,train / test 之間沒有重複。
  • —numpy.random.default_rng(seed=42),可完全重現。

Content warning

內容來自 visual novels,包含 NSFW 素材,並非適合所有用途。

Credit

原始資料集由 joujiboi 製作,授權為 GPL。