逐字稿说话人识别教程|Taption 4 步骤完成人物标记与导出

作者: Taption 音易 | 7月 26号 | 4分钟阅读

核心主题:逐字稿说话人识别、人物标记、讲者分段、语音转文字、TXT 逐字稿导入、SRT 字幕导出


在多人会议、访谈、Podcast 或在线课程中,录音通常不难,真正耗时的是整理逐字稿:不只要校对文字,还得反复回听,确认每一句是谁说的。只要讲者一多,没有姓名与时间轴的长篇文字就很难阅读,也不方便后续搜索、引用或制作字幕。


Taption 说话人识别可将多人对话依讲者分段,再把「Speaker A、Speaker B」改成实际姓名,让逐字稿清楚呈现谁在什么时间发言。本篇将示范如何导入影音与既有 TXT 文字稿、设定讲者人数、完成人物标记,最后导出逐字稿或字幕档。



说话人识别与人物标记有什么不同?


说话人识别(Speaker Diarization)处理的是「谁在什么时候说话」:系统依声音特征把音频切成不同讲者的片段。人物标记则是后续整理步骤,把系统产生的暂时标签替换成主持人、受访者或真实姓名。


  • 说话人识别:自动区分多人声音并依讲者分段
  • 人物标记:将 Speaker A、Speaker B 改成 Amy、Steven 等实际名称
  • 时间轴对齐:让每段文字对应正确的音频或影片位置
  • 结构化输出:保留讲者脉络,方便会议记录、访谈引用与字幕制作

若手上只有连续文字,可先使用逐字稿人物标记流程,让 Taption 依原始影音重新对齐文字并区分讲者。开始前请准备原始影音档、内容相符的 TXT 逐字稿,并先确认大约有几位主要发言者。



Step 1:导入录音或影片档


登录 Taption 后,从档案页上传要处理的录音或影片。建议使用声音清楚、背景噪音较少的原始档;若多人同时抢话或音量差距过大,系统仍可能需要人工确认讲者归属。



需要从零产生文字时,也可以直接使用影音转逐字稿功能;本篇则以「已有 TXT 逐字稿,希望自动加上讲者与时间轴」的情境为例。



Step 2:选择语言并导入 TXT 逐字稿


档案上传后,先选择录音中的主要语言。接着在「文字生成方式」选择「导入 TXT 文字档案」,并上传与影音内容相符的纯文字稿。TXT 的段落不必先标示姓名,但文字顺序应与录音一致。



开启 AI 讲者分段并设定人数


在「文字分段方式」中选择「AI 标记讲者并按不同说话的人分段文字」,再设定影片中的说话总人数。人数设定越接近实际情况,系统越容易维持一致的讲者标签。



  • 以主要发言者为准,短暂插话者可在完成后人工调整
  • 音频中若有旁白、主持人与来宾,请分别计入讲者人数
  • 先确认语言与 TXT 内容正确,再开始处理,可减少后续重做


Step 3:校对逐字稿并替换讲者姓名


转录完成后,先播放几个不同段落,确认文字、时间轴与讲者切换是否一致。点选讲者标签,即可把系统产生的发声者名称改成 Amy、Steven、主持人或受访者等实际身分;同一讲者的其他段落也能以一致名称呈现。



校对时优先检查这三类片段


  • 两位讲者快速交替或彼此重叠的段落
  • 背景音、远端连线或音量突然改变的位置
  • 片头、片尾旁白,以及只短暂出现的发言者

说话人识别的重点是先建立可用的初稿,再由熟悉内容的人做最后确认。姓名、职称与专有名词都应在导出前校对,避免错误沿用到会议记录或正式字幕。



Step 4:导出逐字稿或字幕档


完成文字与人物标记后,开启导出选单,依用途选择 TXT 等逐字稿格式,或导出 SRT 字幕档。若下一步要把内容放回影片,可使用自动上字幕工作流程继续校对、翻译或输出影片。



  • TXT:适合会议记录、访谈整理与内容引用
  • SRT:保留字幕文字与时间码,适合影片平台或剪辑流程
  • 导出前:再次抽查讲者姓名、文字内容与时间轴


常见问题:如何让说话人识别结果更好?


讲者人数一定要完全正确吗?


建议填写实际的主要讲者人数。若不确定,可先计算整段内容中持续发言的人;只在开场短暂出声的人,可视内容重要性决定是否纳入,并在完成后人工修正。


导入 TXT 后,还需要校对吗?


需要。TXT 解决的是文字来源,AI 还要把文字对齐音频并判断讲者切换。重叠发言、背景噪音与远端收音都可能影响结果,因此正式交付前仍应抽查。


哪些情境最适合使用人物标记?


多人会议、研究或客户访谈、Podcast 对谈、在线课程与座谈会都很适合。清楚的讲者标签能让读者快速追踪对话,也方便团队搜索决策、引用发言,或把逐字稿继续制作成字幕。



结语:先分清谁在说话,再整理逐字稿


逐字稿说话人识别能把连续文字整理成有讲者、有段落、有时间轴的内容。依序完成影音导入、TXT 上传、AI 讲者分段、人物命名与格式导出,就能建立更容易校对与使用的逐字稿。


如果你经常处理会议、访谈或 Podcast,可直接体验 Taption 的说话人识别流程;先用 AI 建立结构化初稿,再由熟悉内容的人完成最后校对,会比从头手动标记更适合持续性的影音工作流程。