CoolFace
Datasetpublic

leungtianle/Expressiveness

Expressiveness — UltraVoice 指令语音合成数据集 基于 UltraVoice 的 instruction_text 字段, 使用 IndexTTS-2.5 零样本音色克隆合成的语音数据集。 55,352 条音频,共 166.71 小时,22050 Hz 单声道 WAV (PCM16) 平均时长 10.84 秒 参考音色随机取自 865 个说话人片段,每个音色被使用 41–93 次 仅合成 instruction(提问)部分,response 未合成 数据构成 大类 条数 时长(小时) 小类 accent 6,000 22.64 AU, CA, GB, IN, SG, ZA composite 4,143 10.23 en emotion 21,209 64.81 angry, disgusted, fearful, happy, neutral, sad, surprised generalqa 6,000 9.89 en language 6,000… See the full description on the dataset page: https://huggingface.co/datasets/leungtianle/Expressiveness.

sourceHugging Facecc-by-nc-4.0updated 26d agoView on Hugging Face
0likes59downloads
Dataset Card

Expressiveness — UltraVoice 指令语音合成数据集

基于 UltraVoice 的 instruction_text 字段, 使用 IndexTTS-2.5 零样本音色克隆合成的语音数据集。

  • —55,352 条音频,共 166.71 小时,22050 Hz 单声道 WAV (PCM16)
  • —平均时长 10.84 秒
  • —参考音色随机取自 865 个说话人片段,每个音色被使用 41–93 次
  • —仅合成 instruction(提问)部分,response 未合成

数据构成

大类条数时长(小时)小类
accent6,00022.64AU, CA, GB, IN, SG, ZA
composite4,14310.23en
emotion21,20964.81angry, disgusted, fearful, happy, neutral, sad, surprised
generalqa6,0009.89en
language6,00020.70chinese, japanese, korean
speed6,00019.17fast, normal, slow
volume6,00019.27high, low, normal
合计55,352166.7124 个小类

完整的小类级统计(含各类最短/最长时长)见 ultravoice_stats.md。

文件说明

  • —ultravoice.jsonl — 元数据,每行一条记录:
json
  {
    "key": "ultrachat_586644",
    "split_type": "accent",
    "sub_type": "AU",
    "instruction_text": "Could you share some insights on ...",
    "response_text": "G'day mate! Substance abuse in teenagers ...",
    "instruction_wav_path": "wav/instructions/accent/AU/ultrachat_586644.wav",
    "response_wav_path": "wav/responses/accent/AU/ultrachat_586644_0.wav",
    "dataset_split": "train"
  }

instruction_wav_path 指向本仓库中的合成音频。response_text / response_wav_path 为原始数据集字段,本仓库未合成 response 音频。

  • —wav/*.tar — 按大类打包的音频,共 7 个分片。解包后目录结构为 instructions/<大类>/<小类>/<key>.wav,与 instruction_wav_path 去掉 wav/ 前缀后对应。

使用方式

bash
# 下载
hf download leungtianle/Expressiveness --repo-type=dataset --local-dir .

# 解包(还原为 wav/instructions/<大类>/<小类>/<key>.wav)
mkdir -p wav_extracted
for f in wav/*.tar; do tar -xf "$f" -C wav_extracted; done

解包后把 wav_extracted 重命名为 wav,即可直接用 instruction_wav_path 索引音频。

合成配置

项值
模型IndexTTS-2.5
精度bfloat16
语言标签lang="EN"(所有 instruction_text 均为英文)
音色选择按样本 key 派生随机种子,可复现
情感/语速控制未启用(duration_factor 保持默认 1.0)

注意事项

  • —`sub_type` 描述的是文本内容的风格要求,不是合成音频的实际声学属性。 例如 speed=slow 的样本,其 instruction 文本要求"用缓慢的语速回答",但合成时未启用 duration_factor,音频语速由参考音色决定。同理 emotion、volume、accent 等标签也不反映合成音频本身的情感、音量或口音。
  • —generalqa 的平均时长(5.93 秒)明显短于其他类(11–14 秒),因为它的 instruction 是纯问句,而其他类的文本额外附带了风格指令,文本更长。
  • —composite 类 4,143 条即原数据集该类的全部数量,已取尽。
  • —dataset_split 字段沿用原数据集(train 53,874 / test 1,478),抽样时未按此字段分层。

许可

音频由 IndexTTS-2.5 合成,请遵守 IndexTTS 模型许可。 文本内容来自 UltraVoice 数据集,请遵守其原始许可。