上个月给客户做一条产品解说,我自己录的音,回放时听见空调嗡嗡响外加两次嘴瓢,重录到第五遍心态崩了。后来整段换成 AI 配音,一遍过,从那以后一分钟以上的口播我再没自己念过。
先说我的判断:解说词这种活,AI 已经能吃下绝大部分场景,尤其一分钟到三分钟的产品介绍、课程讲解、内部培训。要有情绪爆发的广告片、要方言、要跟画面严格同步的现场解说,还是找人录。
中文解说我现在主要用 魔音工坊。音色多,男声女声、新闻腔、亲和一点的都有,长句断句比早两年的工具顺,导出前能整段试听。
它的问题在情绪。情绪起伏大的句子,比如「这次真的不一样」,它念出来是平的,听不出强调。我的处理办法是把这类句子单独拎出来重生成几次挑一个,或者干脆改成短句,让语气自己带上去。另外它对多音字和生僻品牌名不灵,「重」该读 chóng 还是 zhòng 它经常选错,我在稿子里直接把可能读错的词换成同义词,比事后一个个加读音标记省事。
英文或者要做多语版本的,我用 ElevenLabs。英文自然度是我用过的里面最舒服的,还能调稳定性和表现力两个滑块,想要稳就调高稳定性。
它短板在中文。中文音色挑起来费劲,很多一听就是合成味,我一般要试七八个才留下一个能用的。同一个句子跑两次语气可能不一样,做系列视频时会前后不统一,我的办法是把挑定的音色存成预设,整季都用这一个。计费和可用额度的具体数字,以官网当前说明为准。
背景音乐我分两条路。要带人声的歌,我用 Suno,输入风格加情绪关键词,或者把产品介绍贴进去让它写词,出来就是一整首,适合做片尾和氛围铺底。
它是抽卡型的。跑五六次能有一首顺耳的就不错,人声咬字偶尔含糊,歌词里夹英文时尤其明显。风格同质化也比较重,跑出来那股味道一听就是它。最关键的一点:生成出来的音乐能不能商用、用在客户项目里要不要标署名,看平台当前授权规则,别默认自己拿到全部权利,接商单前一定去读一遍那条规则。
只要纯音乐不要人声,我用 海绵音乐,输入「轻快」「科技感」「三十秒」这种描述就能出,速度比 Suno 快,一次给好几版可以挑。
它的问题是撞曲。模板感强,热门描述出来的曲子大家都在用,我上周刷到两个不同账号的片子背景音乐几乎一样。我的做法是在它给的几版里挑一版,然后在剪辑里把开头两秒裁掉换个起拍点,再叠一层很轻的音效,撞的概率能降下来。
剪映 自带的音效库我也用,拖进去就有,方便是真方便。缺点是那些热门音效被用烂了,谁都听得出,我现在只拿它做很轻的环境音,键盘声、翻页声这类,主音效另找。
音画对齐我按这个顺序来:先铺解说,再垫音乐,最后加音效。解说轨先锁死,音乐跟着画面的情绪点在起承转合处做淡入淡出。音量上人声保持在 -6 dB 附近,背景音乐压到 -25 dB 上下,音乐盖过人声是最常见的翻车点。有旁白进来的地方,我在音乐轨上画一个三到五秒的自动淡化,让人声一进来音乐自己让路。
语速我一般调到 1.05 倍,听着最像正常说话。低于 1.0 显得拖,超过 1.15 就赶。中文稿件里数字是重灾区,「3.5」有可能读成别的读法,我直接在稿子里写成「三点五个百分点」这种口语写法,一次成型。
解说词怎么改才顺口,我总结成三件事:一是把长句砍成二十字以内,一口气念不完的句子 AI 容易在中间换气;二是把书面语换成口语,「该方案具备较高的落地性」改「这套方案很好落地」,念出来才像人话;三是在需要强调的词前面加空格或逗号,让停顿落在你想强调的地方。
长稿别一次丢进去。超过八百字我按小标题切成几段分别生成,最后在剪辑里拼起来。整段生成有个坑:前面听着还行,到第三分钟语气会慢慢变平,切段生成能避开。
生成完一定要整段听一遍再导出,别只看波形。我吃过一次亏,导出后才发现中间有一句吞了字,客户那边已经拿去配音效了,返工两小时。
更多工具见 AI 视频工具。
你现在一条三分钟的解说,从写稿到出音要花多久?如果超过一小时,可以先从「把长句砍成二十字以内」这一步试起,看看同一段稿子念出来是不是立刻顺了。