算下来,差不多两年没更新了。鸽了这么久,久到我重新登录后台,界面都陌生了——连关键字自动回复功能也悄悄失效。
上个月末,和老同学约茶。他两个孩子在商场里到处好奇地摸摸看看,我笑着说:“幼崽真是精力旺盛。”同学回了一句:“因为他们还对世界好奇啊。人年纪一大,什么都不好奇了,也就躺平了。”
野鹿志的slogan一直是“不断的好奇,不停的学习”。可停更的这两年,我自己好像也丢了这份好奇,没了分享欲。
以前写的内容太长、视频也长,自己做得累,用户也没耐心看完——说白了,大多时候是自我感动。
主要分享我自己制作的各类开源AI项目整合包。后期根据反馈,再对整合包做优化或加新功能。
“保持好奇,才是真正的抗衰老。 我们慢慢来,但不停下来。”
今天给大家分享的整合包是 Index-TTS2 1.0 版本:

项目地址:https://github.com/index-tts/index-tts
这是由B站开源的声音克隆项目,只需上传一段10秒的音频,就能完美复刻目标音色。
我之前一直在用Index-TTS1.5,个人体验非常不错——GitHub 上它已经收获了21K星。
相比 1.5 版本,Index-TTS2最大的升级是加入了情感控制能力。
另外,我在制作整合包时,还额外增加了一些实用功能。
下载压缩包后,推荐使用7-Zip解压,解压路径不要含中文。双击bat文件,等待模型加载完成即可启动。
操作非常简单,上传音频 → 输入文字 → 点击生成,稍等片刻。
生成的语音文件会自动保存在outputs文件夹里。
测试设备:GTX 1070(8G显存),显存占用约7.8G。生成一段7秒的语音,耗时54秒。
实话实说,推理速度偏慢,可能是显卡比较老的原因,后期再看看能不能优化。
勾选“使用情感参考音频”后,除了上传要克隆的音频,还需要再上传一段情感参考音频,让生成的语音带上对应的感情色彩。情感的强烈程度可以通过“情感权重”来调节。
个人觉得这个功能不太实用——毕竟还得专门去找一段情感样本,而且对原参考音色的还原度也不够好。另外,开启后会明显增加推理时间。
使用“情感向量控制”,可以通过调节情感参数来控制生成语音的情感。勾选“情感随机采样”,则每次生成的情感会更具多样性。
这个功能同样存在对原参考音色还原度不够好的问题,也会额外增加推理时间。不过相比“情感参考音频”,它稍微方便一些。
勾选“显示实验功能”后,可以使用情感描述文本控制语音生成,同样也可以搭配情感随机采样来增加多样性。
这个功能属于官方实验版,同样存在对原参考音色还原度不够好的问题,也会额外增加推理时间。
好了,Index-TTS2 的原生功能就是这些。下面说说我在整合包里做了哪些优化和新增功能。
新增音色库,预设了一些常见音色。你也可以把自己想克隆的音频放进voice文件夹,点击“刷新音色列表”即可。
音频格式推荐Wav或Mp3。
新增“保存音色”选项:输入音色名称,点击保存,即可将克隆后的音色添加到音色库中。
这个功能与直接把参考音色放进 voice 文件夹的区别在于:克隆后的音色支持情感控制,也能用于高级生成参数中的设置(关于高级生成参数,我们后面再细说)。
新增语速控制滑块。提醒一下:变速后语音可能会有些失真。
新增生成字幕功能:可根据生成的语音一键生成SRT字幕文件,自动保存到 outputs/subtitles 文件夹。
新增字幕配音功能:点击“字幕配音”按钮,原本输入文字的文本框会变为字幕文件上传区域。
载入SRT字幕文件后,可直接在文本框里编辑文本。点击“生成语音”,即用所选音色为字幕配音。
需要提醒的是:AI模型生成的语音停顿具有随机性,无法与字幕时间轴百分百对齐。
在高级生成参数设置中,我加入了“智能静音优化”选项,勾选后可缩短AI的不合理停顿,让语音更贴合原字幕。
此外,所有参数均已汉化,官方推荐的参数组合也做成了预设,方便直接选用。
“自定义术语词汇读音”是原生功能,我在此基础上增加了“更新词语”和“删除词语”按钮,让编辑更方便。
本次更新的所有优化内容以及高级生成参数的具体含义,我都整理到了WEBUI用户指南文档里,方便大家随时查阅。
好了,以上就是今天给大家带来的全部内容。总的来说,个人感觉Index-TTS2在音色复刻方面表现不错,但情感控制还有一段路要走。
第一次制作AI整合包,肯定有很多不足。欢迎鹿友们评论区提意见,我会根据实际情况和可行性持续优化。
今天要分享的内容就到这里,想要整合包的鹿友
后台撩我
获取。