GPT-SoVITS 是一个声音克隆和文本到语音转换的开源 Python RAG 框架,具有以下特点和使用方法:
GPT-SoVITS:只需1分钟语音即可训练一个自己的TTS模型。GPT-SoVITS是一个声音克隆和文本到语音转换的开源Python RAG框架。5秒数据就能模仿你,1分钟的声音数据就能训练出一个高质量的TTS模型,完美克隆你的声音!根据演示来看完美适配中文,应该是目前中文支持比较好的模型。界面也易用。主要特点:1、零样本TTS:输入5秒的声音样本即可体验即时的文本到语音转换。2、少量样本训练:只需1分钟的训练数据即可微调模型,提高声音相似度和真实感。模仿出来的声音会更加接近原声,听起来更自然。跨语言支持:支持与训练数据集不同语言的推理,目前支持英语、日语和中文。3、易于使用的界面:集成了声音伴奏分离、自动训练集分割、中文语音识别和文本标签等工具,帮助初学者更容易地创建训练数据集和GPT/SoVITS模型。4、适用于不同操作系统:项目可以在不同的操作系统上安装和运行,包括Windows。5、预训练模型:项目提供了一些已经训练好的模型,你可以直接下载使用。GitHub:[https://github.com/RVC-Boss/GPT-SoVITS](https://t.co/BpHX4SlsO3)[…](https://t.co/BpHX4SlsO3)视频教程:[https://bilibili.com/video/BV12g4y1m7Uw/](https://t.co/Uo7WtSSUGO)[…](https://t.co/Uo7WtSSUGO)[[twi]@小互(@_twi(1).mp4](https://bytedance.feishu.cn/space/api/box/stream/download/all/RymsbKdweody4Cxwtsqc7Yuenxd?allow_redirect=1)使用:
先剪出音频,使用https://elevenlabs.io/speech-synthesis或使用GPT-sovits[GPT-SoVITS实现声音克隆](https://waytoagi.feishu.cn/wiki/SVyUwotn7itV1wkawZCc7FEEnGg)克隆声音,做出文案的音频。[heading2]第二步[content]使用wav2lip整合包,导入视频和音频,对口型得到视频。基础wav2lip+高清修复整合包下载地址https://github.com/Rudrabha/Wav2Lip这就是目前的本地跑数字人的方案,效果都差不多,都是用的wav2lip产品https://synclabs.so/
在GPT-SoVITS里,一种方式是多抽,但是没有方法的多抽,无异于海底捞针,越抽越绝望。这里意外发现GPT-SoVITS的一种调整语气和语调的方式,就是换参考音频:比如这句话,期望表现出愤怒💢的情绪:“你凭什么,随便检查我的手机?”以下是分别参考了两条不同语音带来的结果。参考音频:第一条亢奋,第二条比较平静[其他无恶不作的不良人,我操,客为了哈哈!.wav](https://bytedance.feishu.cn/space/api/box/stream/download/all/Fb6qbvLDEoEHl1xsiFlcmICgnPo?allow_redirect=1)[你知道尔威香水多少钱吗?尔威香水两千多一瓶。.wav](https://bytedance.feishu.cn/space/api/box/stream/download/all/Vd2DbKRlIo3HnmxK8xxciWgmnqe?allow_redirect=1)对应的生成结果:生成效果,第一条更接近愤怒💢的情绪。[你凭什么,随便检查我的手机(3).wav](https://bytedance.feishu.cn/space/api/box/stream/download/all/E8LKbphD4oWX25xa3ZLcSbKPn1f?allow_redirect=1)[你凭什么,随便检查我的手机.wav](https://bytedance.feishu.cn/space/api/box/stream/download/all/DEXzb6bfUoyP06xDnZUc6hJ1nTh?allow_redirect=1)