上个月市场部要七条产品讲解短视频,真人出镜排不开档期,我试着全用数字人做。七条做完我自己一次没出镜,交付那天主管还问是不是请了外包。

先说我现在的判断:数字人划算的是信息密度高、画面要求低的内容,也就是主要靠听的那些。产品说明、内部培训、知识口播、政策通知,这类最合适。

反过来,要情绪、要现场感、要观众信你的内容,数字人容易砸。

挑形象这步我劝你别花太久。第一回我在形象库里挑了四十分钟,最后同事说这几个长得差不多。观众记不住脸,记住的是内容。我现在固定一个形象,全公司的视频都用同一张脸,反而攒下辨识度。

蝉镜 是国内平台投放时我第一个打开的。中文形象和音色给得多,模板也多,选形象、贴文案、选音色,一路点下去就能出片,不用自己配音。

它的毛病是形象同质化严重,刷十条同行视频能撞见三张熟脸。唇形也偶尔慢半拍,遇到带 b、p、m 的字更明显,导出前我会把开头三秒反复看几遍。

HeyGen 的质感在我试过的里面算好的,尤其多语言。同一条视频翻成英文、日文,嘴型跟着改,不用重录。做出海内容、给海外客户发讲解,我走它。

中文音色比英文少,挑起来余地小。收费按视频时长算,具体额度和价格以官网或 App 内为准,批量做之前先算一下量。

Synthesia 我主要拿来做内部培训课件。它能直接吃 PPT,一页配一段口播,改文案时不用重出整条视频,改完再生成就行。多语言也是它的强项。

它贵,形象气质偏正式,做活泼的社媒内容不太搭。创意类、要剪辑节奏的活,我不会往里塞。

剪映 严格说不算数字人工具,但我在国内项目里离不开它。数字人出的原始片段干巴巴的,丢进剪映加字幕、加背景音乐、补一段产品实拍当空镜,观感能提一大截。它自带的朗读音色应急也够用。

它的数字人能力有限,形象少、嘴型一般,指望它一条龙出片会失望。当后期工具用,它很称职。

可灵AI 我用来补短镜头。数字人讲到某个产品细节,需要两三秒的实物特写,我就用它的图生视频出一段插进去。

它撑不住长口播。让一个形象连续说一分钟,嘴角和手会出问题,我只让它出三五秒的片段。

音色怎么挑,我按一条标准:跟画面里的形象气质对得上。年轻女声配职场感强的形象,中年男声配稳重的形象,别拧着来。还有个细节,语速我会往慢调一点,默认速度讲信息类内容偏赶,观众跟不上。具体档位各工具不一样,以 App 内为准。

文案要重写一遍,这步省不得。书面语直接丢进去,数字人念出来像在读文件。我改的时候做三件事:长句拆成短句,一句不超过十五个字;加「你」「咱们」这类称呼;书面词换成口头说法,「显著提升」改成「会快不少」。

举个我改过的例子。原文是「本产品支持多端数据实时同步」,我改成「你在手机上改的东西,电脑上马上就能看到」。意思一样,念出来顺。

每段控制在两三句。段落太长,数字人一口气念完没有停顿,听着累。

背景我一般不折腾。产品实拍图、PPT 截图、纯色渐变,这三种轮着用就够。想找现成素材,去免版权图库搜关键词,挑节奏慢、没有明显人物出镜的片子,别抢主体的注意力。授权范围按站内说明来,商用前确认一下。

导出前我会过一遍检查:开头三秒的唇形、有没有念错的专业词、字幕断句是不是在半句话中间断开。专业词念错很常见,我把生僻的产品名写成同音字,或者在文案里直接换掉。

什么时候不该用数字人,我也说清楚。要出镜人真实背书、要讲个人经历、要打动人的内容,数字人一上就是减分。需要观众先信任你的场景,比如招募、医疗建议、投资相关的说明,真人出镜更稳。

更多工具见 AI 视频工具。

你手上那条要做的口播,是念给谁听的?如果是给客户讲功能、给同事讲流程,先把文案按「短句、加称呼、换口语」改一遍再贴进去,改完卡在哪了,留言跟我说说。