核心主題:逐字稿說話者辨識、人物標記、講者分段、語音轉文字、TXT 逐字稿匯入、SRT 字幕匯出
在多人會議、訪談、Podcast 或線上課程中,錄音通常不難,真正耗時的是整理逐字稿:不只要校對文字,還得反覆回聽,確認每一句是誰說的。只要講者一多,沒有姓名與時間軸的長篇文字就很難閱讀,也不方便後續搜尋、引用或製作字幕。
Taption 說話者辨識可將多人對話依講者分段,再把「Speaker A、Speaker B」改成實際姓名,讓逐字稿清楚呈現誰在什麼時間發言。本篇將示範如何匯入影音與既有 TXT 文字稿、設定講者人數、完成人物標記,最後匯出逐字稿或字幕檔。
說話者辨識(Speaker Diarization)處理的是「誰在什麼時候說話」:系統依聲音特徵把音訊切成不同講者的片段。人物標記則是後續整理步驟,把系統產生的暫時標籤替換成主持人、受訪者或真實姓名。
若手上只有連續文字,可先使用逐字稿人物標記流程,讓 Taption 依原始影音重新對齊文字並區分講者。開始前請準備原始影音檔、內容相符的 TXT 逐字稿,並先確認大約有幾位主要發言者。
登入 Taption 後,從檔案頁上傳要處理的錄音或影片。建議使用聲音清楚、背景噪音較少的原始檔;若多人同時搶話或音量差距過大,系統仍可能需要人工確認講者歸屬。

需要從零產生文字時,也可以直接使用影音轉逐字稿功能;本篇則以「已有 TXT 逐字稿,希望自動加上講者與時間軸」的情境為例。
檔案上傳後,先選擇錄音中的主要語言。接著在「文字生成方式」選擇「匯入 TXT 文字檔案」,並上傳與影音內容相符的純文字稿。TXT 的段落不必先標示姓名,但文字順序應與錄音一致。

在「文字分段方式」中選擇「AI 標記講者並按不同說話的人分段文字」,再設定影片中的說話總人數。人數設定越接近實際情況,系統越容易維持一致的講者標籤。

轉錄完成後,先播放幾個不同段落,確認文字、時間軸與講者切換是否一致。點選講者標籤,即可把系統產生的發聲者名稱改成 Amy、Steven、主持人或受訪者等實際身分;同一講者的其他段落也能以一致名稱呈現。

說話者辨識的重點是先建立可用的初稿,再由熟悉內容的人做最後確認。姓名、職稱與專有名詞都應在匯出前校對,避免錯誤沿用到會議紀錄或正式字幕。
完成文字與人物標記後,開啟匯出選單,依用途選擇 TXT 等逐字稿格式,或匯出 SRT 字幕檔。若下一步要把內容放回影片,可使用自動上字幕工作流程繼續校對、翻譯或輸出影片。

建議填寫實際的主要講者人數。若不確定,可先計算整段內容中持續發言的人;只在開場短暫出聲的人,可視內容重要性決定是否納入,並在完成後人工修正。
需要。TXT 解決的是文字來源,AI 還要把文字對齊音訊並判斷講者切換。重疊發言、背景噪音與遠端收音都可能影響結果,因此正式交付前仍應抽查。
多人會議、研究或客戶訪談、Podcast 對談、線上課程與座談會都很適合。清楚的講者標籤能讓讀者快速追蹤對話,也方便團隊搜尋決策、引用發言,或把逐字稿繼續製作成字幕。
逐字稿說話者辨識能把連續文字整理成有講者、有段落、有時間軸的內容。依序完成影音匯入、TXT 上傳、AI 講者分段、人物命名與格式匯出,就能建立更容易校對與使用的逐字稿。
如果你經常處理會議、訪談或 Podcast,可直接體驗 Taption 的說話者辨識流程;先用 AI 建立結構化初稿,再由熟悉內容的人完成最後校對,會比從頭手動標記更適合持續性的影音工作流程。