拿到一段 AI 生成的视频,大多数人的第一反应是挺好的,再生成几段拼起来。真拼了才知道,那叫素材,不叫成片。素材有闪光点,成片要能一口气看完,中间任何一处别扭都会让人划走。我前后拼过十几条,踩的坑集中在四个地方:总长、镜头感、字幕和节奏。
第一件事是先把总长定死,倒着推要几个镜头。短平台一条成片三到五分钟,我自己定的规矩是不超过四分钟,四分钟以内算短片。生成的时候每段控制在三到八秒,那四分钟大概就是三十到五十段。先数好段数再生成,不然你生成到第十段才发现整条太短或者太长,前面全白来。
第二件事是镜头感要统一。AI 每段都是独立生成的,光照、色调、镜头运动全不一样,拼起来像换了十个摄影师。我的办法是先定一个视觉规范:色调偏暖还是偏冷、镜头是推还是平移、主体占画面多大。生成时把这条写进提示词,每段开头都带上。带规范生成的片段,接起来顺很多。
第三件事是每段之间留动作。两段硬切会闪,因为前后两秒的画面差太大。我一般给每段之间留零点二秒的黑场或者转场,转场用最简单的淡入淡出,别用花哨的特效。AI 片段本身有运动感,再加特效反而乱。
第四件事是配音先定。很多人先生成画面再配音,结果画面对不上口型,或者画了二十秒而配音只有十秒,剩下十秒尬着。我现在反过来,先写文案、先录旁白,按旁白的句子切镜头。哪句说完了画面就该停在哪,这个数字生成前就定好。
第五件事是字幕。AI 语音识别的字幕错得多,尤其专有名词。我宁可自己校一遍,十几块钱的手动校对换一条能发的片子值。 通义听悟 这类转录工具出的稿子能省一半时间,但专有名词还是得改。字幕的字号、位置提前定死,别每段换个位置。
第六件事是节奏跟着信息走。镜头不是越快越好,是每段时长要跟那段说的信息量匹配。讲一个复杂概念给六秒,讲一个结论给两秒。我写完文案会标一下每段几秒,照着生成,比拍脑袋决定每个镜头几秒靠谱。
第七件事是开头三秒。这条是完播率的分水岭。AI 生成的片段开头常常是缓慢推进的空镜,看的人还没反应过来就划走了。我把最有信息量的那一段放最前,前三秒就得让人知道这条片子在说什么。
第八件事是结尾。结尾决定人会不会点赞转发,也决定下一条片子的开头怎么接。我一般留一个明确的落点:一句结论、一个动作呼吁,或者留个悬念。AI 生成的结尾片段容易空,补一句字幕比硬做一个画面有用。
第九件事是统一规格。分辨率、帧率、码率,全片必须一致,不然拼接处会抖。我发现很多人生成时不注意,有的 1080 有的 720,拼起来一帧一跳。生成前先把规格定死写进提示词,导出后统一过一道压缩再拼。
第十件事是版权和露脸。AI 生成的人物、背景、音乐,每一项的商用条款都不一样。用之前先看这条音乐能不能商用、这段画面里的人物像不像谁。素材能用是第一步,能商用是第二步,这步跳了就是给自己埋雷。 剪映 这类工具里带的曲库条款相对清楚,省得自己找。
第十一件事是留一条备份轨道。拼接软件里一定留一份原始片段的副本,别在原文件上直接剪。我删过一次误操作,二十分钟的素材全没了,重生成一晚上。备份最不讨巧但最救命的习惯,成片存一份,工程文件存一份,原始片段再存一份。
批量生成的时候一次别超过十段。 Luma 这类工具连续生成十几段之后质量会下滑,风格也会飘,攒着分两批跑反而更稳。中间那段空出来的时间用来定规格和写旁白,比干等着有用。
配音我一般拿 Fliki 这种能按时长对齐的来做,先定每句几秒,它按秒配画面,比我一张张对时间准得多。做完再在 剪映 里统一加字幕和封面,一步到能发的状态。
第十二件事是发之前在手机上看。电脑上看没问题,手机上小屏一缩,字幕就糊了、转场就太快了。每次发之前我都在手机上完整看一遍,能挡掉八成的体验问题。
你要做的是解说型、画面型还是教程型短片?告诉我总长和平台,我按这个给你一份分镜到成片的表,哪几段该短、哪几段该留长直接标出来。