核心主题:逐字稿说话人识别、人物标记、讲者分段、语音转文字、TXT 逐字稿导入、SRT 字幕导出
在多人会议、访谈、Podcast 或在线课程中,录音通常不难,真正耗时的是整理逐字稿:不只要校对文字,还得反复回听,确认每一句是谁说的。只要讲者一多,没有姓名与时间轴的长篇文字就很难阅读,也不方便后续搜索、引用或制作字幕。
Taption 说话人识别可将多人对话依讲者分段,再把「Speaker A、Speaker B」改成实际姓名,让逐字稿清楚呈现谁在什么时间发言。本篇将示范如何导入影音与既有 TXT 文字稿、设定讲者人数、完成人物标记,最后导出逐字稿或字幕档。
说话人识别(Speaker Diarization)处理的是「谁在什么时候说话」:系统依声音特征把音频切成不同讲者的片段。人物标记则是后续整理步骤,把系统产生的暂时标签替换成主持人、受访者或真实姓名。
若手上只有连续文字,可先使用逐字稿人物标记流程,让 Taption 依原始影音重新对齐文字并区分讲者。开始前请准备原始影音档、内容相符的 TXT 逐字稿,并先确认大约有几位主要发言者。
登录 Taption 后,从档案页上传要处理的录音或影片。建议使用声音清楚、背景噪音较少的原始档;若多人同时抢话或音量差距过大,系统仍可能需要人工确认讲者归属。

需要从零产生文字时,也可以直接使用影音转逐字稿功能;本篇则以「已有 TXT 逐字稿,希望自动加上讲者与时间轴」的情境为例。
档案上传后,先选择录音中的主要语言。接着在「文字生成方式」选择「导入 TXT 文字档案」,并上传与影音内容相符的纯文字稿。TXT 的段落不必先标示姓名,但文字顺序应与录音一致。

在「文字分段方式」中选择「AI 标记讲者并按不同说话的人分段文字」,再设定影片中的说话总人数。人数设定越接近实际情况,系统越容易维持一致的讲者标签。

转录完成后,先播放几个不同段落,确认文字、时间轴与讲者切换是否一致。点选讲者标签,即可把系统产生的发声者名称改成 Amy、Steven、主持人或受访者等实际身分;同一讲者的其他段落也能以一致名称呈现。

说话人识别的重点是先建立可用的初稿,再由熟悉内容的人做最后确认。姓名、职称与专有名词都应在导出前校对,避免错误沿用到会议记录或正式字幕。
完成文字与人物标记后,开启导出选单,依用途选择 TXT 等逐字稿格式,或导出 SRT 字幕档。若下一步要把内容放回影片,可使用自动上字幕工作流程继续校对、翻译或输出影片。

建议填写实际的主要讲者人数。若不确定,可先计算整段内容中持续发言的人;只在开场短暂出声的人,可视内容重要性决定是否纳入,并在完成后人工修正。
需要。TXT 解决的是文字来源,AI 还要把文字对齐音频并判断讲者切换。重叠发言、背景噪音与远端收音都可能影响结果,因此正式交付前仍应抽查。
多人会议、研究或客户访谈、Podcast 对谈、在线课程与座谈会都很适合。清楚的讲者标签能让读者快速追踪对话,也方便团队搜索决策、引用发言,或把逐字稿继续制作成字幕。
逐字稿说话人识别能把连续文字整理成有讲者、有段落、有时间轴的内容。依序完成影音导入、TXT 上传、AI 讲者分段、人物命名与格式导出,就能建立更容易校对与使用的逐字稿。
如果你经常处理会议、访谈或 Podcast,可直接体验 Taption 的说话人识别流程;先用 AI 建立结构化初稿,再由熟悉内容的人完成最后校对,会比从头手动标记更适合持续性的影音工作流程。