CoolFace
Apppublic

Neverbe1019/genie-tts-t

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes
App README

Genie TTS Space (Docker)

这是一个部署在 Hugging Face Spaces 的 Genie-TTS 服务,支持:

  • —API 调用(/set_reference_audio、/tts)
  • —内置 Web UI(根路径 /),可直接选择已加载模型与参考音频并试听

1. Web UI 使用

打开你的 Space 首页即可进入控制台(不再是 404)。

操作流程:

  1. 1.在“已加载模型”中选择角色(来自启动时预加载的模型)。
  2. 2.在“参考音频”中选择 reference_audio/ 下的文件。
  3. 3.填写与该参考音频完全一致的文本,点击“设置参考音频”。
  4. 4.输入要合成的文本,点击“生成并播放”。

说明:

  • —Web UI 最终也是调用后端 API,因此与插件调用路径一致。
  • —如果未先设置参考音频,合成会报错并提示先调用 /set_reference_audio。

2. API 快速示例

2.1 设置参考音频

POST /set_reference_audio

json
{
  "character_name": "kisaki",
  "audio_path": "reference_audio/Kisaki_802.ogg",
  "audio_text": "这里填与参考音频一致的文本",
  "language": "jp"
}

2.2 语音合成

POST /tts

json
{
  "character_name": "kisaki",
  "text": "こんにちは、これはテストです。",
  "split_sentence": true
}

返回为音频流。


3. 新增 UI 接口

3.1 获取 UI 选项

GET /ui/options

返回当前已加载角色、角色语言映射、reference_audio 文件列表、已设置引用的角色列表。

3.2 返回可直接播放的 WAV

POST /ui/synthesize_wav

json
{
  "character_name": "kisaki",
  "text": "こんにちは",
  "split_sentence": true
}

这个接口会返回带 WAV 头的完整音频,方便网页播放器直接播放。


4. 环境变量

  • —GENIE_MODEL_REPO_ID:模型仓库,默认 clown145/my-genie-tts-models
  • —GENIE_PRELOAD_CHARACTERS:启动时预加载角色,逗号分隔,默认 kisaki
  • —GENIE_MAX_PRELOAD:最多预加载数量,默认 1

示例:

text
GENIE_PRELOAD_CHARACTERS=kisaki,may
GENIE_MAX_PRELOAD=1

5. 兼容性说明

  • —当前镜像基于 python:3.10-slim。
  • —兼容 Genie-TTS 新版本(最低 Python 3.10)。
  • —已默认限制缓存角色数和预加载数,以降低免费 Space OOM 风险。