上个月接过一个急活,客户把一场两小时的行业论坛录屏丢给我,说明天上午要字幕。他自己先用工具跑了一遍,打开一看,专业术语错了三分之一,说话人还串了好几处。
我接过手,从拿到文件到交稿用了二十分钟。能这么快,靠的是一套固定动作,不是手速。
先说工具。讯飞听见 是我做转写的第一选择,中文识别率和说话人分离都稳。两小时的论坛录屏丢进去,出来的稿子专业词命中率比我试过的其他几款高,这一点在行业内容上差别很明显。
它的弱点是方言重或者现场回声大的素材会明显掉准。碰到这种原始音频,我会先做降噪再转写,准确率能回来一截。
通义听悟 的价值在转写之后的整理。它会自动抽章节摘要和待办事项,一场两小时的会议,我看摘要就能知道哪几段值得精读。做大量会议记录时,这个摘要功能省的时间比转写本身还多。
它对口语化的闲聊段处理一般,摘要偶尔会把客套话当成要点。我拿它做粗筛,不做终稿。
飞书妙记 最方便的地方是稿子能直接编辑并且和音频对齐。点稿子里的任意一句,音频跳到对应位置,校对时不用在播放器里拖来拖去找。这个交互在做精细校对时非常关键。
它依赖飞书的生态,团队内部不在飞书上的话,协作分享会麻烦一些。跨团队交付我一般导出字幕文件再发。
腾讯会议 的实时字幕适合会中看。开着字幕开会,听不清的地方能立刻看文字补上,会后导出还能当整理底稿。它的转写在安静环境下够用,多人同时说话时容易串行。
校对的正确顺序是先改专有名词,再看时间戳,最后通读。我一开始顺序反了,从头通读一遍,改完错别字发现术语还是错的,白干一轮。
术语表要提前准备。行业论坛这类内容,公司名、产品名、人名是重灾区,AI 几乎必然写错。我的做法是先从议程或者嘉宾名单里把这些词抄出来,做成一个替换清单,在稿子里全局替换一遍。这一步十分钟能搞定,却决定了成品的可信度。
数字要单独核。年份、百分比、金额,AI 转写经常把「百分之三十」听成「百分之十三」,把「两千」听成「两千二」。这类错误在通读时很容易滑过去,我会用搜索把所有数字跳出来逐个对。
时间戳的问题在长句。转写经常把一整段话压在一个时间区间里,字幕跳出来时观众还没读完就切了。我把超过两行的内容手动断开,让每句单独占一个时间区间,读起来节奏才正常。
说话人标签要抽查。多人场合里,AI 会在两个人抢话时把标签串掉,出现 A 的话标成 B。我一般跳到几个明显有来回对话的段落,核对标签有没有接反。全片核对太慢,抽查五处基本能覆盖。
翻译这块我分成两步走。第一步先用工具把整篇翻一遍,第二步自己逐句润色。直接拿机翻结果发出去,最大的问题不是语法,而是语气不对,中文里很自然的表达翻成英文会显得生硬或者夸张。
DeepL 是我做初翻的选择,它在长句的语序处理上比纯机翻顺,专业词的一致性也保持得不错。它的中文到英文表现稳定,小语种要看具体语种,使用前最好先试翻一段验证。
润色时我重点改三处。一是把被动语态改回主动,读起来更直接;二是把中文里堆的形容词砍掉一半,英文里会显得啰嗦;三是把成语和俗语换成对应的直白表达,硬译出来的英文没人看得懂。
字幕文件最后要过一遍格式。我交付用 SRT,检查一遍有没有空行缺失、编码是不是 UTF-8。这两处出问题,客户那边的播放器会直接乱码或者字幕不显示,前面所有工作都白费。
我现在的固定流程是:讯飞听见 出底稿,飞书妙记 做对齐精修,会议类素材先用 通义听悟 抽摘要定位重点,需要多语言版本再上 DeepL 初翻加人工润色。
提醒一句,凡是涉及合同、医疗、法律这类强责任的内容,AI 转写只能当草稿。这类稿子我一定会逐字听一遍原始音频再交付,效率再高的工具也替代不了这个责任。
更多工具见 AI 办公工具。
你现在要处理的是会议记录还是对外的成品视频?音频是多长时间、几个说话人?告诉我这几个数,我可以直接给你一份校对顺序和时间预算。