AI视频生成怎么样?楼下大爷看完说像真的
前两天楼下张大爷来我家借蒜,看见我电脑上放着一个视频,愣是站那儿看了半天,扭头问我“这是你哪个亲戚拍的?
”我说大爷,这是AI生成的呀,他那个表情啊,眼镜都快掉下来了,直呼“这跟真的一模一样,那以后拍电影是不是不用演员了”。
哈哈,我当时就乐了,但回头一想,他这个问题还真挺有代表性的。
说实话我用AI视频生成也就这一两个月的事。
刚开始纯属好奇,拿我家闺女一张照片丢进去,写了一段“她在海边捡贝壳”的描述,等了几分钟,出来一个几秒钟的短片。
头发丝被风吹起来那个细节都做出来了(这个我真没想到),但手指头有点糊,背景里的海浪也像是复制粘贴了三层似的。
核心结论
如果你问我AI视频生成到底怎么样,我这么说吧:做那种五六秒的氛围短片,它绝对是yyds,发朋友圈、给家里人看个新鲜,完全够用。但你要想拿它整一个两分钟有剧情有对话的故事,那还是先省省吧,坑多到你怀疑人生。
我上个月18号在杭州出差,晚上在酒店没事干,试了差不多四五款主流的AI视频工具(具体名字就不说了,免得像打广告)。
有一个做风景转场的,那叫一个丝滑,森林到雪山的过渡比我用剪映手动拼的强了不知道多少倍。
但换到人物说话的场景,嘴型能对上的概率大概也就三成,另外七成那嘴动得跟嚼口香糖似的。
张大爷看完说像真的那个视频,其实是我用了一张他认识的老街坊的照片,然后输了一句“她在菜市场挑西红柿,笑着跟摊主说话”。
生成出来的画面里,西红柿的颜色、菜市场的灯光、甚至她衣服上的褶皱都很真。
但你要是连着看两遍,就会发现她挑西红柿的动作是循环的,同一个动作重复了三次。
这个破绽张大爷没看出来,我闺女一眼就指出来了,说“妈妈这个奶奶怎么一直在拿同一个西红柿”。
所以这玩意儿拿来给长辈看个乐呵,绝对能唬住人。
但你要是拿它当正经的影视素材,那得做好反复修改的准备。
具体方法
我踩了这么些坑,也摸出几个还算实用的门道,你听听有没有用。
- 提示词里一定要写清楚镜头是固定的还是运动的。我一开始写“一个女孩在走路”,出来那画面晃得我差点晕车。后来改成“镜头固定,女孩从画面左侧走到右侧”,稳多了。
- 人物正脸特写比全身远景靠谱。远景里那些手脚啊、背景里的人啊,崩的概率特最好别高。我试过生成一个街景,结果背景里出现了三个长着同一张脸的路人,吓我一跳。
- 如果你要生成连续的几段视频,每一段单独生成,别指望一次性给你讲完一个故事。我试过一个提示词写了三百多字,出来就是一锅乱炖,啥也没讲清楚。
- 生成时长选五秒左右最稳。我试过拉到十秒,中间就开始出现莫名其妙的变形,有一次一个人的胳膊突然变细了,跟面条似的。
还有就是,那些标着“高清”“4K”的选项,有时候生成出来反而更假。
我对比过同一段描述,普通清晰度的那版看着更像手机随手拍的,高清那版像游戏过场动画,反而没有了真实感。
这个你自己多试几次就懂了。
对了,我昨天在厨房边炖汤边试了一个新提示词,写的是“老式居民楼阳台,晾着的白衬衫在风里飘,下午四点的光”。
这个场景我太熟悉了,因为我妈家阳台就这样。
生成出来那个光影,绝绝子,衬衫的质感也很对。
但晾衣绳居然在半空中断了一截,又接上了(这个我真服了)。
所以你看,AI视频生成的强项是氛围和质感,弱项是逻辑和连贯。你让它做一个有情绪的画面,它完成度很高。你让它做一个需要前因后果的事,它就露馅了。
我现在的用法就是:拍产品图的时候,用它生成一些生活化的使用场景当背景素材。
比如我卖一个杯子,就生成一段“清晨厨房台面上,杯子旁边有面包和咖啡”的五秒视频,放在商品详情页里当动态背景。
成本几乎为零,效果比静态图好不少。
之前找摄影师拍这种场景,一次至少得花个三五百,现在省了。
但你要说拿它做口播视频、做课程讲解,那还是老老实实自己录吧呀。
我试过用AI生成一个“老师站在黑板前讲课”的画面,结果黑板上的字全是乱码,老师的手还穿过了黑板。
这种硬伤在正经内容里根本不能用。
张大爷后来又问了我一句,说那以后是不是随便谁都能当导演了。
我说大爷,导演还是得有人当,AI顶多算个特别听话但不太聪明的摄影助理。
你让它拍什么它拍什么,但它不知道为什么要拍这个。
反正你要是想玩玩,现在就可以拿自己照片试一段,花不了几个钱,有的还免费。
但别一上来就整大制作,从五秒的小片段开始,慢慢摸它的脾气。
这东西就跟和面似的,水多了加面,面多了加水,急不得。