datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
HomoRich-G2P-Negara-v1-Gemini-TTSDeepDialogue-orpheus-G2Pja-tts-g2p-bench
ja-tts-g2p-bench — 日本語 TTS の「漢字の読み(g2p)」性能ベンチマーク
日本語の漢字は同じ表記でも文脈によって読みが変わります(例: 市場→しじょう/いちば)。
このデータセットは TTS が漢字を正しく読み分けられるか を評価する 151 問のベンチマークです。
データ構成
data/items_read_bench_v1.jsonl — 151 問のベンチマーク項目(文・対象漢字・期待読み・代替読み)
results_read_bench.jsonl — 4 エンジン × 2 ASR の評価結果
blindspot_wav/{engine}/ — 各 TTS エンジンが生成した WAV ファイル
gemini/ — Google Gemini (gemini-2.5-flash-preview-tts)
openai/ — OpenAI (gpt-4o-mini-tts)
qwen3/ — Qwen3 (cosyvoice2-0.5b via DashScope)
voicevox/ —… See the full description on the dataset page: https://huggingface.co/datasets/kawajiri-tellernovel/ja-tts-g2p-bench.g2pk2_datasethakka_g2p
TEST
Subset
lang_group
hours
n_utts
n_chars
secs/utt
chars/sec
Hakka_Hailu
客語_海陸
0.00
3,327
82,469
0.00
0.00
Hakka_Sixian
客語_四縣
0.00
1,510
88,013
0.00
0.00
Total
-
0.00
4,837
170,482
0.00
0.00
TRAIN
Subset
lang_group
hours
n_utts
n_chars
secs/utt
chars/sec
Hakka_Dapu
客語_大埔
0.00
50,853
629,333
0.00
0.00
Hakka_Hailu
客語_海陸
0.00
185,865
3,909,5680.00
0.00
Hakka_Raoping
客語_饒平
0.00
20,015
140,783
0.00
0.00
Hakka_Sixian
客語_四縣
0.00
313,640… See the full description on the dataset page: https://huggingface.co/datasets/formospeech/hakka_g2p.
