CoolFace
Datasetpublic

Aynursusuz/tts-zh-zonos2-expressive

ZONOS2 — Accurate vs Expressive (Mandarin voice cloning) Side-by-side A/B comparison of Zyphra/ZONOS2 accurate mode (accurate_mode=true) vs expressive mode (accurate_mode=false). Same reference voice and same target text per row, cloned twice — one per mode — so each can be heard back to back. Reference voices are clean Qwen3 generations. Columns column meaning index row id ref_text text of the reference voice ref_audio reference voice (cloning… See the full description on the dataset page: https://huggingface.co/datasets/Aynursusuz/tts-zh-zonos2-expressive.

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes18downloads
Dataset Card

ZONOS2 — Accurate vs Expressive (Mandarin voice cloning)

Side-by-side A/B comparison of Zyphra/ZONOS2 accurate mode (accurate_mode=true) vs expressive mode (accurate_mode=false).

Same reference voice and same target text per row, cloned twice — one per mode — so each can be heard back to back. Reference voices are clean Qwen3 generations.

Columns

columnmeaning
indexrow id
ref_texttext of the reference voice
ref_audioreference voice (cloning source)
clone_texttarget text spoken in both clones
clone_accurateclone, accurate mode
clone_expressiveclone, expressive mode
dnsmos_accurateDNSMOS P.835 OVRL of the accurate clone
dnsmos_expressiveDNSMOS P.835 OVRL of the expressive clone
keep_accurateTrue if dnsmos_accurate >= 3.0 (quality filter)
keep_expressiveTrue if dnsmos_expressive >= 3.0 (quality filter)

DNSMOS measures signal quality only — not expressiveness/prosody, which is best judged by ear.