CoolFace
Apppublic

kwau/sovits-isla

sourceHugging Faceupdated 3y agoView on Hugging Face
0likes
flask_api.py61 linesDownload Raw Back to root
1import io2import logging3 4import soundfile5import torch6import torchaudio7from flask import Flask, request, send_file8from flask_cors import CORS9 10from inference.infer_tool import RealTimeVC, Svc11 12app = Flask(__name__)13 14CORS(app)15 16logging.getLogger('numba').setLevel(logging.WARNING)17 18 19@app.route("/voiceChangeModel", methods=["POST"])20def voice_change_model():21    request_form = request.form22    wave_file = request.files.get("sample", None)23    # 变调信息24    f_pitch_change = float(request_form.get("fPitchChange", 0))25    # DAW所需的采样率26    daw_sample = int(float(request_form.get("sampleRate", 0)))27    speaker_id = int(float(request_form.get("sSpeakId", 0)))28    # http获得wav文件并转换29    input_wav_path = io.BytesIO(wave_file.read())30 31    # 模型推理32    if raw_infer:33        # out_audio, out_sr = svc_model.infer(speaker_id, f_pitch_change, input_wav_path)34        out_audio, out_sr = svc_model.infer(speaker_id, f_pitch_change, input_wav_path, cluster_infer_ratio=0,35                                            auto_predict_f0=False, noice_scale=0.4, f0_filter=False)36        tar_audio = torchaudio.functional.resample(out_audio, svc_model.target_sample, daw_sample)37    else:38        out_audio = svc.process(svc_model, speaker_id, f_pitch_change, input_wav_path, cluster_infer_ratio=0,39                                auto_predict_f0=False, noice_scale=0.4, f0_filter=False)40        tar_audio = torchaudio.functional.resample(torch.from_numpy(out_audio), svc_model.target_sample, daw_sample)41    # 返回音频42    out_wav_path = io.BytesIO()43    soundfile.write(out_wav_path, tar_audio.cpu().numpy(), daw_sample, format="wav")44    out_wav_path.seek(0)45    return send_file(out_wav_path, download_name="temp.wav", as_attachment=True)46 47 48if __name__ == '__main__':49    # 启用则为直接切片合成,False为交叉淡化方式50    # vst插件调整0.3-0.5s切片时间可以降低延迟,直接切片方法会有连接处爆音、交叉淡化会有轻微重叠声音51    # 自行选择能接受的方法,或将vst最大切片时间调整为1s,此处设为Ture,延迟大音质稳定一些52    raw_infer = True53    # 每个模型和config是唯一对应的54    model_name = "logs/32k/G_174000-Copy1.pth"55    config_name = "configs/config.json"56    cluster_model_path = "logs/44k/kmeans_10000.pt"57    svc_model = Svc(model_name, config_name, cluster_model_path=cluster_model_path)58    svc = RealTimeVC()59    # 此处与vst插件对应,不建议更改60    app.run(port=6842, host="0.0.0.0", debug=False, threaded=False)61