我做一档十来分钟的音频节目,访谈加个人讲述掺着来。最大的门槛不是我内容不够,是声音。家里录音有回响,楼下有车声,我普通话也不算标准。前几期硬着头皮自己念,剪完听着别扭。后来我把声音这块整个拆给 AI 做,节目才稳定下来。
现在的分工是这样的:真人对话的部分保留现场录音,用工具处理;我自己的旁白段落改成 AI 配音;片头和垫乐全部用 AI 生成。下面按这个顺序说我怎么选。
旁白:中文用魔音工坊,多语用 ElevenLabs
我每期要念的开场、串场和结尾加起来大概三四分钟,这部分我现在不自己念了。
中文的旁白我用魔音工坊。它的中文发音自然,多音字和标点停顿处理得比较细,音色库里有接近电台的沉稳款,也有偏日常的。我选了一个中低音的男声,每期固定用同一个,听感上就有了节目的辨识度。调语速和停顿都在网页上做,一段一段听,不对就重生成,不用重新录。
要做英文版本或者嘉宾有外语素材的时候,我用 ElevenLabs。它在跨语言的语气上做得细,情绪和停顿能跟原文走,不会念成念稿机器。我一般先用中文写好,再翻成英文,然后让它念,比自己上阵念英文自然得多。
有个细节要说。旁白别整段一次生成。我会按段落切,一段一段出,中间留出自然的呼吸点,剪起来也灵活。整段一次出,节奏会平,听着像广告。
片头曲和垫乐:用 Udio 起,海绵音乐本地化
播客要有自己的片头,十几秒那种。以前我用现成的免版权音乐,问题是撞车的太多,听别人的节目听到同一段,很出戏。后来改成自己生成。
我用 Udio生成片头。方法是不写具体旋律,只写风格、速度、情绪和乐器,比如「轻快的原声吉他,中速,温暖,无鼓」这种。它出的是带人声的完整歌,我要的是纯器乐,所以在描述里写清楚不要人声,出几条挑一段。它的音质和人声自然度评价高,做出来的东西不廉价。
同一段音乐我用 Suno也生成过一版对照,两家风格偏向不一样,多试几个通常能挑到对味的。片头定下来之后,我把这条音乐存好,每期都用它,不做更换。
中文口味重一点的垫乐我用海绵音乐。它生成的中文歌曲和旋律更贴国内的听感,中间插一段轻音乐过场,或者做一句带人声的节目口播,都比纯英文模型顺。
音乐生成完记得看授权。Udio和 Suno免费档生成的曲子在商用上有限制,我的节目没挂广告就不太在意,但要是接商单,得先确认订阅档位的授权范围,别等到播出后才发现问题。
剪辑和响度:这是最容易忽略的一块
音乐和旁白都齐了,还有一步是把它们放到一条时间线上对齐响度。播客的行业习惯是整体响度稳定,人说话的时候垫乐压低,说完再抬起来。
我的做法是先把旁白铺在主干轨上,再找每条旁白之间的空档,把垫乐剪成对应的长度,垫在人声下面,音量压到刚好听见但不抢话。进入正题前的那几秒,音乐可以稍微抬一点,做一个进入感。
这一步不用专业软件也能做,我用普通的音频剪辑工具,手动切几刀,比让 AI 自动配乐更可控。自动配的乐经常在某句话中间突然变调,反而更麻烦。
我踩过的坑
第一个坑是把 AI 音乐和人声叠在一起,糊成一团。两条声音的频率打架,听感很闷。后来我养成习惯,垫乐音量压得比想象中更低,宁可几乎听不见,也不要盖住人声。
第二个坑是片头太长。我第一版做了四十秒,自己听着挺得意,剪进节目里发现听众早就跳过了。现在控制在十到十五秒,一句口播一个音效就完事。
第三个坑是长音频的处理。一期十几分钟,工具一次性处理会卡或者超时。我按章节切成三四段分别处理,处理完再拼,稳得多。
第四个坑是音色不统一。我中间换过一次旁白音色,老听众立刻听出来,评论里问是不是换了人。后来我固定一个音色,从头用到现在。
你做的是访谈还是单人口述,单期多长?这两个决定了你是主打真人录音加处理,还是可以让 AI 承担大部分旁白。你说一下,我把对应的音色、语速和响度参数再写细一点。