前两周同事做新品落地页,设计师甩过来六张成品图,运营问能不能让它们动起来。我接了这活,六张图一口气丢进图生视频,第一批出来的四张里有三张动得像抽搐,人脸还塌了一块。

后来我想明白一件事:图生视频干的活是让模型猜画面里什么该动、往哪个方向动。图本身信息糊,模型就乱猜,出来的东西自然怪。挑图这一步,比后面调提示词更能决定成败。

我挑图现在守三条自己立的规矩。一是主体清晰独立,人就一个人,产品就一件,背景尽量干净。二是画面里别带字,尤其是中文小字,一动就糊成墨团。三是主体别贴画框边缘,镜头一推一拉,边上最先变形。

这三条立住,剩下的交给工具。

可灵AI 我现在用得最多。进图生视频入口,上传图片,下面有运镜控制的选项,镜头前进、后退、环绕、平移,直接点就行,不用自己写英文提示词。我给那张咖啡杯的图点了缓慢推进,出来的镜头稳,杯口的蒸汽也在飘。

它的麻烦在排队,高峰期一次要等挺久,具体以官网或 App 内为准。人物也是它的弱项,手一抬起来就容易多一根手指,做人物特写我会换工具。

海螺AI视频 对运镜指令的响应是我试过几个里最听话的。同一张图,我在提示词框里写「镜头从右向左缓慢平移,人物头部轻微转向镜头,背景虚化不变」,它基本照做,不会自己加戏。做人物镜头我现在默认走它。

代价是它有抽卡属性。同一句提示词跑三遍,三遍都能用算运气好,我一般一次跑三到四条再挑。想一次命中就交付的活,别指望它。

Luma AI 适合风景、氛围、空镜这类不太需要精确控制的东西。海面、云、城市夜景丢进去,动起来的质感很舒服,光影过渡自然。我做过一张海边日落的图,出来的水波和云走得比我预想的还好看。

反过来,它不太听具体指令。你写镜头向右,它未必向右,随机性大。要的是可控的商业镜头我不选它,选它是为了那种说不清的氛围感。

PixVerse 的模板和特效多,做社媒短平快的内容很省事。上传图,选一个现成特效,出来的东西谈不上高级,发朋友圈、发小红书够用。

缺点是模板味重,一眼能看出是哪款特效,做品牌片显得廉价。清晰度也一般,放大屏上就露怯。

Vidu 我主要用它的首尾帧。上传一张首图再上传一张尾图,中间过程让它自己补,这功能做转场特别好使。我做过一个从产品正面转到背面的镜头,只给了两张图,中间那段转得很顺,比单给一张图硬猜稳得多。

它在真人写实上一般,皮肤质感偏假,做动漫、插画风格的图反而更稳。

竖屏这事我踩过坑。给短视频平台做素材,一开始我拿横屏图去生成,出来的 16:9 硬裁成竖屏,主体直接被切掉半个头。后来改成原图就出 9:16,常见分辨率 1080×1920,具体支持哪些档位以官网或 App 内为准。源头是竖的,后面才不用救。

提示词我现在固定这么写:主体加动作,加镜头方向,最后补一句「背景保持静止」。最后那句是后来加的。早先没写,模型经常把整张图都搅动起来,背景里的树、招牌、路人一起扭,看着像地震。加上这句之后只有主体在动,画面一下子干净了。

失败了别急着改提示词,先看原图:主体是不是本来就模糊,光线是不是太暗,构图是不是太满。八成的问题出在图本身,换一张图比重跑十次有效。

一次跑出来的片段都不长,几秒的量级,想凑成一条完整短片,得一段一段生成再剪到一起。时长上限各工具不一样,以官网或 App 内为准。

最后一道工序我放在剪辑里。片段之间加硬切或者叠化,配上音乐,节奏感全靠这一步。图生视频出来的原始素材直接发,观感都很平。

更多工具见 AI 视频工具。

你手上那张想动的图是哪儿来的?如果是 AI 生成的图或者电商白底图,先按「主体清晰、不带字、不贴边」这三条过一遍再上传,卡在哪一步了,留言跟我说说。