首页/资讯动态/技术前沿

AI「对口型」是怎么做到准的:星幕引擎口型同步技术解读

观众判断一部AI影视「假不假」,往往只需要三秒:听的是粤语,动的是普通话口型——违和感瞬间拉满。口型同步,是AI影视出海遇到的第一道坎,也是星幕引擎过去一年迭代最密集的模块之一。

难点:声音换了,嘴型为什么不能重画一遍

直觉上的方案是「按新配音重新生成口型」,但这条路走不通:口型一变,面部光影、咬肌起伏、下颌线全部要重新计算,角色的辨识度会在几十轮迭代里悄悄流失——这正是「跨集不崩脸」最难保住的环节。所以星幕选择的方向不是重画,而是「翻译」:把新语言的语音拆解成与原始表演等价的嘴部指令。

三层系统:从音素到表情再到节奏

第一层是音素映射层:把配音音频切分为音素序列,与角色的基础口型库逐帧对齐,建立「发音—嘴形」的映射;第二层是表情融合层:口型不能单独存在,系统会叠加角色当前的情绪权重——同样一句台词,愤怒时的咬牙与疲惫时的松唇完全不同;第三层是节奏微调层:字与字之间的过渡帧由插值生成,并受语速曲线约束,避免「机关枪式」开合。

「口型不是动画,是呼吸。观众看到的从来不是嘴,是一个人在说话。」——动画技术组

实测数据:96.8%与一次返工

在最近三个月的多语言版本测试中,星幕引擎口型同步的自动匹配准确率达到96.8%,剩余误差集中在语速极快的争吵戏与含混音段落——这类镜头会进入人工精修队列,单集精修工时约为制作总时长的3%。作为对照,早期版本这个数字是11%,每一集都要配音演员进棚重录口型参考。

28种语言背后的同一套流程

目前《星辰边境》《长安幻夜录》等作品的海外版本覆盖28种语言,粤语、四川话等方言版本也在其中。所有版本共用同一条口型同步管线:配音完成后24小时内产出预览,主创确认后进入渲染。值得一提的是,这套系统同样会用于即将播出的「蓬莱卷」——渡海篇里那段三分钟的渔歌对唱,每种语言版本都会重新「对一遍嘴」。

想了解星幕引擎的更多技术细节,可以回顾群像场面调度技术解读与分镜预演技术解读;多语言配音的完整清单见《从普通话到28种语言》专题。

← 返回资讯列表 下一篇:「星幕开放日」第二期报名指南 →

让每个角色,用自己的声音说每句话

从音素到呼吸,从一种语言到二十八种语言——星幕引擎的口型管线仍在迭代。