用AI生成短视频,武汉的自媒体人都在用哪3个技巧?
上个月底,差不多是4月几十号吧,我在武汉光谷的一家咖啡馆里碰到老陈,啦。
他以前是拍美食探店的,扛着单反满武汉跑,户部巷、万松园那些犄角旮旯的摊子他都蹲过。
那天他盯着手机屏幕傻笑,我凑过去一看——他在用AI生成短视频,一条关于“武汉夏天的绿豆沙”的片子,从文案到画面全是AI搞的,他连家门都没出。
我一开始也不信,现在想想都傻(无奈)
“你这也太偷懒了吧?”我问他。
老陈把手机递过来,说你以为我闲着呢,我一天出二十条片子,光靠手动剪辑得累死。
他给我看了他工作室的后台,六个账号同时在跑,都是AI生成的短视频。
我当时就愣住了,因为我自己也试过用AI做视频,出来的东西总觉得差点意思——要么画面像PPT,要么配音听着像机器人念经。
老陈说,那是你没摸到门道。
他点了根烟,开始跟我掰扯。
我把他说的东西整理了一下,又结合我自己后来踩的坑,大概有这么三四个技巧,武汉这边做得好的自媒体人基本都在用。
老陈说的第一句话就让我挺意外的。
他说很多人用AI生成短视频,上来就写“帮我生成一条关于武汉美食的视频”,这种提示词扔给C,hatGPT,出来的东西能看才怪。
他自己是怎么干的呢?
他先手动写一个脚本框架,比如“开头三秒要出现热干面的特写,中间穿插芝麻酱搅拌的慢动作,结尾用一个武汉话的‘蛮扎实’收尾”。
把这个框架丢给AI,让AI只负责填充具体的文案和画面描述。
他说这就叫提示词工程里的“半自动模式”。
全自动的AI视频生成工具他也试过,像神马某映的AI功能、还有几个国外的平台,出来的画面总有一种“塑料感”。
(这个我真没想到,我以为越自动越好呢)后来他改成自己搭骨架、AI填血肉,效率反而上来了。
老陈那天说了不少,我挑三个我觉得最实用的。
我问他具体怎么填。
他说比如做一条“武汉过早”的短视频,他会给ChatGPT这样的指令:“你是一个在武汉住了二十年的吃货,用口语化的武汉方言写一,段关于豆皮的文案,要提到糯米、肉丁、香菇,语气要像在跟邻居聊天,不要用‘首先’‘然后’这种词。
”这种提示词扔进去,出来的文案直接能念,连配音都省了AI味。
第一个是用AI绘画工具做分镜素材。
他不用AI直接生成整条视频,而是先用Midjourney或者Stable Diffusion生成十几张关键画面的静态图。
比如要做一条关于“武汉轮渡”的视频,他就让AI画“黄昏时分的武汉长江大桥,桥下有轮渡驶过,江面有橘色反光,胶片质感”。
生成个七八张,挑三四张最顺眼的,再用AI视频工具让这些图动起来。
他说这样出来的画面有电影感,不是那种一眼假的AI视频。
我试过用这个方法做了一条关于“武汉秋天落叶”的片子。
先让AI画了几张“东湖绿道上的梧桐叶,阳光透过树枝洒在地上,有微风”的图,然后传到某个AI视频工具里加了个缓慢推镜头的效果。
发到抖音上,居然有人问我是用哪款相机拍的。
(其实全是AI画的,绝绝子)
第二个技巧是用ChatGPT做本地化配音脚本。
老陈说很多AI生成的视频配音听着别扭,是因为文案太书面了。
他会在提示词里加一句“请用武汉方言的语序写,但不要出现太难懂的词”。
比如“这个豆皮蛮好吃”比“这个豆皮非常美味”更适合短视频。
他还专门建了一个文档,里面存了几十条武汉方言的常用表达,每次生成文案的时候就把这个文档的内容一起丢给AI参考。
第三个是自动化办公工具串起来用。
老陈的工作流是这样的:先用ChatGPT生成文案,然后把文案复制到一个叫“飞书”的文档里,再用一个自动化工具(他用的好像是Zapier)把文档里的内容自动推送到AI视频生成平台。
他只需要在最后一步手动调整一下画面顺序。
他说这样一条视频从文案到成片,差不多四五分钟就能搞定。
我问他那画面质量怎么保证。
他说你别指望AI一次生成就完美,他一般会生成三四个版本,挑一个能用的,剩下的就当废片删掉。
反正AI生成不要钱,就是花点时间。
那天从咖啡馆出来,武汉的晚风还挺舒服的。
我后来自己在家试了老陈说的这几个技巧,做了一条关于“武汉夏天的绿,豆沙”的视频——先让AI画了五张图,选了三张,再用ChatGPT写了段武汉话的文案,最后用AI配音。
发出去之后播放量比我之前手动剪的还高一些。
我媳妇在旁边看我捣鼓,说你现在连门都不出就能做视频了?
我说是啊,但绿豆沙还是得下楼买。
对了,昨天我又碰到老陈,他说他现在开始用AI生成“虚拟探店”的视频了——就是让AI画出一个不存在的武汉小店,然后配上真实的武汉街道声音。
我说你这不骗人吗?
他说你傻啊,我标注了“AI生成”啊,观众就当看个乐子。
我想了想,好像也有道理。
反正这几个技巧你拿去试试,别指望AI能替你思考,但它确实能替你干活。做短视频这事,工具再厉害,最后拼的还是你对武汉这座城市的理解。