各位鹿友,我是老鹿。今天给大家带来的是Duix-Avatar(原 HeyGem)数字人整合包。
制作周期偏长,本人水平有限,敬请见谅。制作不易,恳请各位鹿友一键三连。
HeyGem(现官方名 Duix-Avatar)
是硅基智能的半开源 AI 数字人项目,刚推出就被网友称作海外工具 HeyGen 的开源平替。
相比HeyGen免费版限制多、年付费几百美元,HeyGem主打免费本地运行,目前GitHub已有13K+星标。它最早以 HeyGem.ai出圈,后官方统一品牌更名为Duix-Avatar,本质是同一个项目。

项目地址:https://github.com/duixcom/Duix-Avatar
特意跟大家说明:它并非完整开源 —— 仅开放前端界面,核心的数字人生成逻辑全封装在Docker镜像里,没有公开源码。
按官方原生方式,想在Windows上跑,得先装Docker软件,并且要启用WSL2(相当于给Windows装个Linux子系统),对小白来说部署门槛不低。
也正因为拿不到核心源码,这次整合包我反复调试了很久,周期才拉长。
后续我会继续优化、尝试加功能,但可改动范围有限,提前跟各位鹿友打个招呼。
整合包无需安装Docker,解压即用,推荐使用7-Zip解压,完成后双击启动器即可运行。
首次启动时,启动器会自动检测电脑是否已安装WSL,如未安装则会自动安装并提示重启电脑。
重启电脑后,再次双击启动器,会先显示WSL安装成功,随后自动解压WSL镜像包。
解压完会自动把镜像导入WSL系统。这个流程只有第一次打开整合包才会跑,导入成功以后,下次再开就不用等这么久了。
导入成功后自动检测CUDA版本。整合包建议使用12.8及以上版本:若低于12.0会提示更新;若介于12.0与12.8之间会提示建议更新,但不影响使用;若高于12.8则直接启动程序,打开WebUI。
整合包的核心功能很简单:上传一段视频和一段音频,点击生成即可。
传的视频建议为人物正面、面部清晰、光线充足、色彩明亮的素材。
本次整合包新增了两个选项:
推理批次和分辨率缩放因子。
推理批次默认4,代表每次同时处理4帧,显存足够时可适当提高该数值来加快速度。
分辨率缩放因子用于降低原视频分辨率,例如设为0.5即缩放至50%。当上传的视频分辨率较大时,可尝试提高该值。
测试设备为1070显卡(8G显存),峰值占用约7.8G。若您的显卡为6G显存,建议将推理批次设为2,缩放因子设为0.5。
新增面部超分功能,勾选后会在视频推理完成后自动执行超分。
不过超分效果有限,面部会有轻微失真。如需高质量修复,建议使用Topaz Video这类专业软件处理。
缓存文件自动保存至temp文件夹,新增一键清理按钮,方便释放空间。
此外还有一个隐藏优化:当上传的音频时长大于视频时长时,原逻辑是重复正放,导致衔接不连贯。
我改为了正放→倒放→正放……交替循环来适配音频长度,让过渡更自然。
特别提示:本期 HeyGem 整合包可以与上期分享的 Index-TTS2 整合包配合使用——先克隆语音,再生成数字人。
为此我特意设置了不同的端口,两者可以同时运行互不干扰。对有口播需求的鹿友应该会很有帮助。
最后我给大家准备了一个清理WSL的脚本。如果后续不再需要使用整合包,双击运行该脚本后重启电脑即可完成清理。
重启后可以双击“验证WSL”脚本确认是否清理干净。
注意:清理后再次打开启动器,会重新进入安装、解压、导入WSL的完整流程。
好了,今天要分享的内容就到这里,想要整合包的鹿友
后台撩我
获取。