AI视频生成中如何用关键词控制人物动作连贯性?
我跟你说
说真得,玩AI视频生成这一年多,我最大的感悟就是…… 指望一句话让AI乖乖听话,不如指望我家猫自己洗澡,哦, (这,个我真没想到) 但你要是摸到那个窍门,动作连贯性这事,真能给你省下大半包烟。
身边五六个朋友都踩了这一步,被家人念叨好久(摊手)
上个月18号,我在某剪映里折腾一个“人物转身坐下”的镜头……
好家伙,每回生成都是衣服变了个人,脸也换了亲妈都认不出。
后来我才反应过来,不是AI笨,是我压根没给它“锁住人”的指令。
现在先说结论,控制动作连贯性的核心不是写“作了什么”,而是写“谁在什么状态下一气呵成做了什么”。
关键词里必须包含三样东西:人物特征锁定、动作时间线、还有环境关系 少了任何一个,画面就放飞自我。
那条微博我发了五遍,最后加了个“全程保持同款发型、同色外套、面部特征不变”…… 立马就稳了八成。
你看,这就是关键词的“锚点”作用。
核心结论
先把最直白的道理扔这儿:动作连贯性 = 人物锚点 + 动作链路 + 运动幅度控速。人物锚点就是上面说的“谁”,动作链路就是“先A接着B再C”,运动幅度控速就是少用“快速”“猛跑”这类词。
你写“女人从椅子上站起,转身,走向窗外”——AI大概率会给你玩出三个分身。
但如果你写“同一女人,扎着马尾,穿蓝色围裙,保持面部一致,从椅子,上缓缓站起,转身,朝窗外迈两步停下”…… 连贯性立刻提升一个量级。
这里面有个坑,我差点摔死:千万别把动作写成“先……然后……最后……”,AI对顺序词的理解其实很弱。
它更吃“A动作,接着B动作”这种隐性的推进感。
或者用“from A to B”的英文结构,比如“from stand,ing to sitting”,很多底模对这个更敏感。
没错,有时候英文关键词反而比中文更好使,绝绝子。
那天我在杭州转机,闲着没事拿手机试了试“跑”这个动作…… 不加任何限制,生成二十秒直接变成丧尸出笼。 加了“步幅均匀、手臂自然摆动、身体轻微上下起伏”之后…… 他娘的,终于像个正常人了。
具体方法
给你套我用了半年的笨办法,目前还没翻过车(至少没翻得那么惨)。在关键词里分段式输入,用逗号加空格隔开,每一段控制一个层面。
先写人物锚点:“纯正中国男子,三十岁左右,短发,穿灰色连帽卫衣,黑色裤子,全身无变化”。
再写背景:固定场景,不要换。
然后写动作链路:“身体先向前倾,双手扶膝,然后缓慢蹲下,拿起地上的绿色瓶子,再站起来,把瓶子放在桌面”。
注意,我写“然后”但是AI这个蠢萌的东西其实是靠上下文,猜的…… 所以聪明人会把“然后”改成“保持上述动作顺序,人物不出现任何形变”。
再教你一个杀招,把关键帧的长宽比调成1:1或者3:4,别老用几十:9。
竖屏横屏的动作预测难度真的不一样,我拍脑袋猜的,但实测就是16:9容易抽风。
还有,在负面提示词里写“变形、闪烁、闪烁、衣服突变、手部扭曲、脸部错误”,能挡掉一半低级事故。
真的,某runway gen2我都快用吐了,正面提示词写得再好,负面不写等于裸奔。
还有个更进阶的玩法,把一句话拆成两段关键词,用“然后”连接不同镜头。
比如镜头一:特写脸部,保持表情不变;镜头二:中景全身,继续上一步动作。
这样AI会把每个镜头当作“连续过程的一部分”,而不是重新生成的独立片段。
但你要注意,每段之间加个“动作衔接,过渡自然”…… 不然它还是能给你玩出瞬移。
对了,昨天买菜路过小区门口,看到一大爷用手机拍树上的鸟…… 突然想到其实拍,视频也是同一个道理,你摁住一个焦点不动,鸟飞走再飞回来,画面依然连贯。
AI生成也一样,你得给它一个“焦点”——就是那件灰卫衣,那根马尾,那条围裙。
焦点不动,动作再乱也能拉回来。
最后分享个我自己经常用的句式,“slowly transition from [动作A] to [动作B], keep the same clothing, hairstyle and face throughout”。
这串词在好几个工具里都灵,比中文成功率高出差不多三成。
如果你用的是某国产工具,那就在后面再加一句“画面稳定,不要重新绘制角色”…… 虽然它不一定认,但心里踏实。
哦对了,运动幅度这块,控制在“小范围移动”优先级大于“剧烈动作”。
你让角色从左边走到右边,连贯性崩一半;但让角色从坐在椅子上到站起来,几乎完美。
所以初期可以多安排那种“原地起身”“原地转身”“原地抬手”的动作。
等这些都稳了,再慢慢加位移…… 别一上来就飞檐走壁,AI真的会谢。
今天就聊到这儿吧,我得去给我的某云盘续费了…… 刚看了一下上个月的账单,又超了一百多,绝了。
反正记住,关键词不是写作文,是往模子里浇水泥。
水泥的形状,你得给得够细,够油滑,才能脱模出好东西。
祝你生成的动作,一个镜头能干到底。