leungtianle/Expressiveness
Expressiveness — UltraVoice 指令语音合成数据集 基于 UltraVoice 的 instruction_text 字段, 使用 IndexTTS-2.5 零样本音色克隆合成的语音数据集。 55,352 条音频,共 166.71 小时,22050 Hz 单声道 WAV (PCM16) 平均时长 10.84 秒 参考音色随机取自 865 个说话人片段,每个音色被使用 41–93 次 仅合成 instruction(提问)部分,response 未合成 数据构成 大类 条数 时长(小时) 小类 accent 6,000 22.64 AU, CA, GB, IN, SG, ZA composite 4,143 10.23 en emotion 21,209 64.81 angry, disgusted, fearful, happy, neutral, sad, surprised generalqa 6,000 9.89 en language 6,000… See the full description on the dataset page: https://huggingface.co/datasets/leungtianle/Expressiveness.
Expressiveness — UltraVoice 指令语音合成数据集
基于 UltraVoice 的 instruction_text 字段, 使用 IndexTTS-2.5 零样本音色克隆合成的语音数据集。
- 55,352 条音频,共 166.71 小时,22050 Hz 单声道 WAV (PCM16)
- 平均时长 10.84 秒
- 参考音色随机取自 865 个说话人片段,每个音色被使用 41–93 次
- 仅合成 instruction(提问)部分,response 未合成
数据构成
完整的小类级统计(含各类最短/最长时长)见 ultravoice_stats.md。
文件说明
ultravoice.jsonl— 元数据,每行一条记录:
{
"key": "ultrachat_586644",
"split_type": "accent",
"sub_type": "AU",
"instruction_text": "Could you share some insights on ...",
"response_text": "G'day mate! Substance abuse in teenagers ...",
"instruction_wav_path": "wav/instructions/accent/AU/ultrachat_586644.wav",
"response_wav_path": "wav/responses/accent/AU/ultrachat_586644_0.wav",
"dataset_split": "train"
} instruction_wav_path 指向本仓库中的合成音频。response_text / response_wav_path 为原始数据集字段,本仓库未合成 response 音频。
wav/*.tar— 按大类打包的音频,共 7 个分片。解包后目录结构为instructions/<大类>/<小类>/<key>.wav,与instruction_wav_path去掉wav/前缀后对应。
使用方式
# 下载
hf download leungtianle/Expressiveness --repo-type=dataset --local-dir .
# 解包(还原为 wav/instructions/<大类>/<小类>/<key>.wav)
mkdir -p wav_extracted
for f in wav/*.tar; do tar -xf "$f" -C wav_extracted; done解包后把 wav_extracted 重命名为 wav,即可直接用 instruction_wav_path 索引音频。
合成配置
注意事项
- `sub_type` 描述的是文本内容的风格要求,不是合成音频的实际声学属性。 例如
speed=slow的样本,其 instruction 文本要求"用缓慢的语速回答",但合成时未启用duration_factor,音频语速由参考音色决定。同理emotion、volume、accent等标签也不反映合成音频本身的情感、音量或口音。 generalqa的平均时长(5.93 秒)明显短于其他类(11–14 秒),因为它的 instruction 是纯问句,而其他类的文本额外附带了风格指令,文本更长。composite类 4,143 条即原数据集该类的全部数量,已取尽。dataset_split字段沿用原数据集(train 53,874 / test 1,478),抽样时未按此字段分层。
许可
音频由 IndexTTS-2.5 合成,请遵守 IndexTTS 模型许可。 文本内容来自 UltraVoice 数据集,请遵守其原始许可。
