上周帮一个做职场培训的团队处理直播回放,一场九十分钟,要出八条能发的短视频。他们之前的做法是让实习生从头看到尾,边看边记时间点,一个人干一整天。我接手后改了流程,同样的工作量压到两小时出头。
差别不在手速,在顺序。下面这套是我现在固定用的。
先拿到文字稿,这一步不能跳。腾讯会议 录制的会议和直播自带转写,导出之后你能直接看到每句话在几分几秒。我把整场转写导成文本,用关键词搜主题,比拖进度条找快十倍。
它的转写在多人抢话或者方言重的时候准确率会掉,所以我只拿它定位时间点,不当最终字幕用。定位错了后面全错,这一步宁可多花五分钟核对。
剪映 是我切片的主力。把长视频丢进去,它的智能字幕能自动识别说话内容并生成时间轴,我在文本里删掉不要的段落,时间线跟着一起变。这个「改文字就是改视频」的逻辑,是切片效率的关键。
它的缺点是长视频上偶尔会卡,九十分钟的素材对机器配置有要求,配置一般的话预览会掉帧。我通常先按主题把长视频粗剪成几段十几分钟的中段,再逐段精修,机器压力小很多。
蝉镜 我用来补口播。有些段落原始画面是共享屏幕,切出来不好看,我就把那段音频抽出来,用数字人重新生成一段口播画面替换掉。观众看到的是人在讲,而不是一张静态的 PPT。
数字人这条路的边界要认清楚。它适合信息密度高、表演要求低的讲解类内容,情绪表达目前还是模板化的,做情感叙事会露怯。我只在信息讲解段用它,故事和案例段一律用真人原片。
HeyGen 是做多语言版本时用的。同一段口播内容要出英文版,我用它生成对应语言的口型视频,省掉重新录制的成本。英文口型的同步度做得不错,中文反而不如国内工具贴合。
它的长处在出海场景,代价是价格不便宜,而且国内访问稳定性要看网络环境。纯做中文内容,用它有点浪费。
竖屏这一步很多人做反了。正确顺序是先定竖屏画布,再重新构图,而不是横屏导出后再裁。裁出来的画面主体经常偏在一边,人的脸贴在角落里,观感很差。我在剪映里直接建竖屏工程,把主体重新框一遍,最后再补上下方的字幕区。
字幕的排版也有讲究。短视频的字幕要短,一行不超过十五个字,字号要够大。我看到最多的失败案例是把长句整段压上去,观众在手机上根本读不完就划走了。短句分行,一行一行跳,读起来才跟得上。
开头三秒决定生死。切片出来的第一条我一定挑冲突最强或者结论最反直觉的那段,把最有信息量的那句话提到最前面。原始视频的顺序是按直播时间走的,而短视频的顺序要按吸引力排,这两套顺序几乎从来不一致。
结尾我会留一个具体的钩子,比如「下一条讲怎么跟老板谈加薪」。这种明确的预告比「关注我」有用得多,观众知道点进来还能拿到什么。
八条切片做完我统一过一遍音量。原始长视频里不同段落的音量经常不一致,尤其是中途换了麦克风或者插了电话连线的场次。我把每条的响度拉到接近的水平,观众连续刷到时才不会觉得忽大忽小。
还有个容易翻车的细节,切片里如果出现了「刚才我们说过」这类指向上下文的话,单独看会很莫名其妙。我会在字幕里补半句解释,或者干脆把这类段落跳过不选。切片要能独立成立,这是硬标准。
我现在的固定搭配是:转写定位用 腾讯会议,主力切片交给 剪映,画面不好看的段落用 蝉镜 补数字人口播,出海版本上 HeyGen。九十分钟素材出八条,熟练之后两小时能收工。
如果你一个月要切十几场,建议把上面这套做成检查清单贴墙上。漏掉定位这步,后面每一条都会多花十分钟。
更多工具见 AI 视频工具。
你现在手上的长视频是多长,主讲人是一个人还是多人对话?告诉我这两点,我能直接给你一套切片的时间预算和条数建议。