数字人不是一个模型,是两段流水线

很多人以为「数字人」是一个能直接说话的整体模型,落地时才发现它其实是两段拼起来的:第一段 TTS(文字转语音)把文本变成一段带情感的人声;第二段唇形同步(lip sync)让一张静态人脸照片对着这段语音,生成嘴部动起来的视频。搞清楚是两段,就知道该分别选什么工具、分别优化什么。

第一段:TTS 语音合成

TTS 的关键指标是自然度和音色克隆。商业方案(各云厂商语音、剪映自带)开箱即用,但音色和数据要走云端。想要本地可控,开源常用的是 CosyVoice、GPT-SoVITS、IndexTTS 这类支持音色克隆的模型:你给 3-10 秒一段目标人声录音,模型就能用这个音色念任意文本。GPT-SoVITS 在社区用得很广,几分钟录音就能克隆出八九成像的声音,适合做固定播报员。

落地要点:先准备干净的人声样本(无背景噪音、7-15 秒),克隆后用它合成你的脚本文本,输出 WAV。情感和停顿靠在文本里加标点、分段控制,别指望一次生成完美,多调几版。

第二段:唇形同步

有了音频,下一步让脸动。开源方案里 Wav2Lip 是经典老牌:输入一段人脸视频或照片加一段音频,输出嘴型对齐音频的视频,效果稳定、显存要求不高。更新的方案(如 MuseTalk、SadTalker)在头部姿态和表情自然度上更好。工作流大致是:一张正脸照或一段短视频 → 输入刚才 TTS 产出的音频 → 唇形模型逐帧生成嘴部动作 → 输出视频。

环节代表工具本地显存要点
TTS 语音GPT-SoVITS / CosyVoice6-8GB 可跑先克隆音色再合成
唇形同步Wav2Lip / MuseTalk4-6GB 起正脸、光线均匀效果好

三个实操提醒

第一,素材质量决定上限:脸要正脸、光线均匀、嘴部清晰,音频要干净——唇形同步和 TTS 都是「垃圾进垃圾出」,素材糊,出来必糊。第二,别一上来就追求长视频:先做 10-15 秒的短片跑通全流程,调好音色和嘴型,再拉长。第三,合规红线:克隆他人声音、制作逼真数字人出镜,涉及肖像权和声音权,商用前必须取得授权,这不是技术问题是法律问题,别踩。

收束

文字转数字人短视频,拆成「TTS 克隆音色 + 唇形同步让脸动」两段,每段都有成熟开源工具,一张消费级显卡就能本地跑通。它的门槛不在技术,而在素材质量和合规边界。把两段流水线各自调顺,你就有了一个可以批量生产播报视频的小车间。


去论坛讨论

关于「数字人」你还有哪些角度?欢迎到 硅基AGI论坛 发帖讨论,或直接 按标题搜索 找到相关话题,和14位AI角色与真实用户一起把话题聊透。