成都自媒体人分享:AI视频生成口播稿,如何让数字人表情自然?
天下午,我再某东下单的补光灯到了,拆快递的时候还在想,这玩意儿到底能不能解决数字,人眼神发飘的问题哈。
结果装上一试,嘿,还真有点用。
不过今天不聊补光灯,聊聊最近后台被问爆的少数个事儿——AI视频生成口播稿,数字人表情怎么才能不像个假人?
别嫌麻烦,这一步真的关键,多吃了一周的苦
我踩这个坑踩了差不多俩月。
刚开始用某款数字人工具,生成出来的口播视频,那表情简直是灾难。
眼睛瞪着,嘴角像被两根线提着,说话的时候头倒是会晃,但眼神完全是死的。
我拿给一个做短视频的朋友看,他直接说“你这像被绑架了”。
气得我啊,当天晚上就翻来覆去睡不着,凌晨两点还在翻各种教程,结果大部分都是教你调参数,什么“自然度调高一点”、“表情幅度设置成XX”,屁用没有。
参数拉满了,出来的效果是还尴尬。
后来我发现,问题根本不在参数上,在稿子上。
你想啊,数字人的表情是AI根据你输入的文案内容去猜的。
你给它的稿子是那种正经八百的书面语,什么“众所周知”、“总而言之”,它上哪儿知道该配什么表情去?
它只能瞎蒙。
我试过把一篇很正式的产品介绍稿丢进去,出来的数字人全程面无表情,偶尔挤出一个假笑,还跟台词对不上,那个违和感,绝绝子(这个词我平时不用,但今天必须用一下)。
然后我就换了个思路。
我把自己平时在镜头前说话的方式,完完全全靠大白话写出来。
就那种,你会跟朋友安利东西的语气,带点口头禅,带点“你们知道吗”、“这个东西真的绝了”。
而且我在写稿的时候,会刻意在句子中间加上情绪提示词,比如“(有点惊讶)”、“(忍不住笑)”、“(摊手)”。
你别说,还真管用。
AI读到括号里的提示,表情就跟着变了。
虽然偶尔还是会慢半拍,但至少不是死鱼眼了。
而且我发现一个特别逗的事,就是语速。
你把稿子里的标点符号改一改,逗号多放几个,句子短一点,数字人的表情自然度能提升好几档。
因为它有更多时间去“反应”和“思考”那句台词的情绪。
之前我写的稿子,一句话恨不得三十个字不带喘气的,AI念都念不过来,哪还有功夫做表情?
后来我把每句话控制在差不多十个字以内,断句断得贼碎,效果立马不一样了。
对了,昨天补光灯到货的时候,我家猫正好跳上桌子,把那个柔光箱给碰倒了,吓我一跳。这跟主题没关系,就是想到了顺便提一嘴。
数字人表情自然的关键,不是调参数,而是喂给它“人话”和“情绪提示”。
就这么简单。
你把它当成一个刚入行的新手演员,你得告诉它哪儿该笑,哪儿该皱眉,它才能给你演出来。
你只丢给它一段干巴巴的文案,它就只能给你干巴巴的表演。
我后来又把这套方法试了另外两三个工具,像某剪映的数字人、某闪剪,基本都适用。
但有一个细节要注意,就是提示词别写太复杂。
我之前试过写“(此时内心充满喜悦但外表尽量克制并带有一丝羞涩)”,结果AI直接卡壳了,表情变得特别扭曲,像抽筋似的。
后来改成“(偷笑)”,效果反而好。
所以提示词越简单越好,就两三个字,最好是一个动词加一个情绪状态。
还有一个坑,就是别用太长的稿子。
我一开始贪心,想一次生成个两三分钟的完整视频。
结果数字人讲到后半段,表情就开始崩,眼神涣散,嘴型也对不上了。
后来我改成一段一段生成,每段就三十秒左右,然后在剪辑软件里拼起来。
虽然麻烦点,但至少每一段的情绪都是连贯的,看起来没那么假。
我甚至试过在稿子里加一些语气词,比如“嗯”、“啊”、“就是”、“那个……”,数字人居然会眨眼睛了。
你说神奇不神奇?
这可能是因为语气词给了它一个停顿的时间,它借那个空隙做出了一点微表情。
反正我现在写口播稿,以经习惯了那种口语化的节奏,自己读起来也顺,生成出来的数字人看着就自然多了。
所以你要问我具体怎么做,我就给你说几个我一直在用的土办法,不算多高深,但真实用。
前几天有个同行问我,说用了我的方法还是不行,我让他把稿子发我看看,结果他写的是“我们的产品采用了先进的纳米级涂层技术,能有效抵御日常刮擦”。
我当时就乐了,这玩意儿你让真人念都念不出表情来,AI能给它整出啥样?
后来我帮他改成了“你们平时手机放包里,跟钥匙磨来磨去,怕不怕?
我就怕,但我这个壳,真不怕。
”那效果,立马就对了。
反正就是,别把数字人当人工智能,把它当成一个特较真的模仿者。你给它什么,它就还给你什么。你给它教科书,它就给你念课文的表情,你给它段子,它就有讲段子的脸。这一条想通了,基本就告别僵尸脸了。
现在我做口播视频,基本三四分钟就能搞定一段,生成完稍微剪一下就能发。
虽然跟真人出镜还是有差距,但糊弄一下短视频平台的算法和大部分观众,足够了。
最后提一句,我昨天那猫把补光灯碰倒之后,我换了个角度重新架好,发现光线从侧面打过来,数字人脸上的阴影层次更好看了,这算意外收获吧。
就这样,想到哪儿写到哪儿,希望对你有用。