Neverbe1019/genie-tts-t
0
Genie TTS Space (Docker)
这是一个部署在 Hugging Face Spaces 的 Genie-TTS 服务,支持:
- API 调用(
/set_reference_audio、/tts) - 内置 Web UI(根路径
/),可直接选择已加载模型与参考音频并试听
1. Web UI 使用
打开你的 Space 首页即可进入控制台(不再是 404)。
操作流程:
- 在“已加载模型”中选择角色(来自启动时预加载的模型)。
- 在“参考音频”中选择
reference_audio/下的文件。 - 填写与该参考音频完全一致的文本,点击“设置参考音频”。
- 输入要合成的文本,点击“生成并播放”。
说明:
- Web UI 最终也是调用后端 API,因此与插件调用路径一致。
- 如果未先设置参考音频,合成会报错并提示先调用
/set_reference_audio。
2. API 快速示例
2.1 设置参考音频
POST /set_reference_audio
{
"character_name": "kisaki",
"audio_path": "reference_audio/Kisaki_802.ogg",
"audio_text": "这里填与参考音频一致的文本",
"language": "jp"
}2.2 语音合成
POST /tts
{
"character_name": "kisaki",
"text": "こんにちは、これはテストです。",
"split_sentence": true
}返回为音频流。
3. 新增 UI 接口
3.1 获取 UI 选项
GET /ui/options
返回当前已加载角色、角色语言映射、reference_audio 文件列表、已设置引用的角色列表。
3.2 返回可直接播放的 WAV
POST /ui/synthesize_wav
{
"character_name": "kisaki",
"text": "こんにちは",
"split_sentence": true
}这个接口会返回带 WAV 头的完整音频,方便网页播放器直接播放。
4. 环境变量
GENIE_MODEL_REPO_ID:模型仓库,默认clown145/my-genie-tts-modelsGENIE_PRELOAD_CHARACTERS:启动时预加载角色,逗号分隔,默认kisakiGENIE_MAX_PRELOAD:最多预加载数量,默认1
示例:
GENIE_PRELOAD_CHARACTERS=kisaki,may
GENIE_MAX_PRELOAD=15. 兼容性说明
- 当前镜像基于
python:3.10-slim。 - 兼容 Genie-TTS 新版本(最低 Python 3.10)。
- 已默认限制缓存角色数和预加载数,以降低免费 Space OOM 风险。
