说实话,这个数字人项目被严重低估了。
外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。
它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。
整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。
有两种用法。
1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。
2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。
硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上)
安装方法,不复杂,
让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。
PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。
显示更多