maotianchen/maobailing_rvc
297
maobailing_rvc — RVC v2 / 40kHz 声线克隆模型
一款基于 RVC(Retrieval-based-Voice-Conversion-WebUI)v2、在 40kHz 采样率下训练的中文女声声线克隆模型。
数据集来源
训练该模型所用数据集全部来源于index-tts 2克隆产物,未使用任何人类语音数据训练。
模型简介
文件清单
maobailing_rvc.pth # RVC 推理模型(53 MB)
maobailing_rvc.index # faiss 索引(IVF751_Flat_nprobe_1, ~89 MB)
maobailing_rvc_trained.index # faiss 训练索引(~2.3 MB)
config.json # 模型配置
PARAMS.md # 完整参数说明
README.md # 本说明
LICENSE # Apache-2.0训练数据
- 中文女声干声数据集(6 段 FLAC,单声道,22.05kHz,约 29.4 分钟)。
- 预处理:切片为 163 段;重采样 40k / 16k;RMVPE 提取 f0;HuBERT 提取 768 维特征。
- 说话人:单一说话人(speaker_id = 0)。
使用方法(RVC WebUI / 命令行)
- 将
maobailing_rvc.pth放入assets/weights/,maobailing_rvc.index放入assets/indices/。 - WebUI 中选择模型
maobailing_rvc,设置推荐参数: index_rate = 0.6、rms_mix_rate = 0.5、protect = 0.4、f0_method = rmvpe、f0_up_key = 0(女声偏高/吃力可调 ±2)。- 上传干声,点击转换。
命令行推理(参考):使用 RVC 的 VC 接口(get_vc + vc_single)。关键环境变量需设为: weight_root=<assets/weights>、rmvpe_root=<assets/rmvpe>、index_root=<assets/indices>; 超长音频建议设 RVC_CUDA_GRAPH=0 并分段处理。
环境
- Python 3.12.13
- torch 2.7.1+cu118、torchaudio 2.7.1+cu118
- faiss-cpu 1.15.0、transformers 4.49.0、gradio 3.14.0、librosa 0.10.2、soundfile 等
- 仓库版本要求 Python 3.12(依赖文件
requirments_cu118_py312.txt)
说明:安装时未启用 onnxruntime-gpu(其依赖的nvidia-cudnn-cu11==8.9.5.29在 PyPI/镜像上不存在,且与 torch 冲突;该路径仅用于 Windows/DirectML,Linux+CUDA 推理不需要)。详见PARAMS.md。
许可
本项目模型按 Apache License 2.0 发布,详见 LICENSE。训练数据与使用场景请遵守相应版权与授权要求。
致谢
- RVC-Project / RVC-Boss 的 RVC 框架;index-tts 2;RMVPE、ContentVec/HuBERT、HiFi-GAN / VITS 等相关开源项目。
