hhim8826/japanese-anime-speech-v2-split-150k
japanese-anime-speech-v2-split-150k joujiboi/japanese-anime-speech-v2 的 150,000 筆隨機子集,已切好 train / test。 split rows train 135,000 test 15,000 total 150,000 Columns audio — 16 kHz mp3,與原始資料完全相同(未重新編碼) sentence — 轉錄文字(原始欄位名為 transcription) How it was built 來源的 sfw(271,788 筆)與 nsfw(20,849 筆)兩個 split 都有使用,並依原始比例分配名額 (sfw 139,313 / nsfw 10,687)。 在每個 split 的全部列上做無放回均勻抽樣,因此每筆資料被選中的機率相同。 抽出後整體打亂,前 15,000 筆為 test,其餘為 train,train / test… See the full description on the dataset page: https://huggingface.co/datasets/hhim8826/japanese-anime-speech-v2-split-150k.
japanese-anime-speech-v2-split-150k
`joujiboi/japanese-anime-speech-v2` 的 150,000 筆隨機子集,已切好 train / test。
Columns
audio— 16 kHz mp3,與原始資料完全相同(未重新編碼)sentence— 轉錄文字(原始欄位名為transcription)
How it was built
- 來源的
sfw(271,788 筆)與nsfw(20,849 筆)兩個 split 都有使用,並依原始比例分配名額 (sfw 139,313 / nsfw 10,687)。 - 在每個 split 的全部列上做無放回均勻抽樣,因此每筆資料被選中的機率相同。
- 抽出後整體打亂,前 15,000 筆為 test,其餘為 train,train / test 之間沒有重複。
numpy.random.default_rng(seed=42),可完全重現。
Content warning
內容來自 visual novels,包含 NSFW 素材,並非適合所有用途。
Credit
原始資料集由 joujiboi 製作,授權為 GPL。
