逐字稿說話者辨識教學|Taption 4 步驟完成人物標記與匯出

作者: Taption 音易 | 6月 23號 | 4分鐘閱讀

核心主題:逐字稿說話者辨識、人物標記、講者分段、語音轉文字、TXT 逐字稿匯入、SRT 字幕匯出


在多人會議、訪談、Podcast 或線上課程中,錄音通常不難,真正耗時的是整理逐字稿:不只要校對文字,還得反覆回聽,確認每一句是誰說的。只要講者一多,沒有姓名與時間軸的長篇文字就很難閱讀,也不方便後續搜尋、引用或製作字幕。


Taption 說話者辨識可將多人對話依講者分段,再把「Speaker A、Speaker B」改成實際姓名,讓逐字稿清楚呈現誰在什麼時間發言。本篇將示範如何匯入影音與既有 TXT 文字稿、設定講者人數、完成人物標記,最後匯出逐字稿或字幕檔。



說話者辨識與人物標記有什麼不同?


說話者辨識(Speaker Diarization)處理的是「誰在什麼時候說話」:系統依聲音特徵把音訊切成不同講者的片段。人物標記則是後續整理步驟,把系統產生的暫時標籤替換成主持人、受訪者或真實姓名。


  • 說話者辨識:自動區分多人聲音並依講者分段
  • 人物標記:將 Speaker A、Speaker B 改成 Amy、Steven 等實際名稱
  • 時間軸對齊:讓每段文字對應正確的音訊或影片位置
  • 結構化輸出:保留講者脈絡,方便會議紀錄、訪談引用與字幕製作

若手上只有連續文字,可先使用逐字稿人物標記流程,讓 Taption 依原始影音重新對齊文字並區分講者。開始前請準備原始影音檔、內容相符的 TXT 逐字稿,並先確認大約有幾位主要發言者。



Step 1:匯入錄音或影片檔


登入 Taption 後,從檔案頁上傳要處理的錄音或影片。建議使用聲音清楚、背景噪音較少的原始檔;若多人同時搶話或音量差距過大,系統仍可能需要人工確認講者歸屬。



需要從零產生文字時,也可以直接使用影音轉逐字稿功能;本篇則以「已有 TXT 逐字稿,希望自動加上講者與時間軸」的情境為例。



Step 2:選擇語言並匯入 TXT 逐字稿


檔案上傳後,先選擇錄音中的主要語言。接著在「文字生成方式」選擇「匯入 TXT 文字檔案」,並上傳與影音內容相符的純文字稿。TXT 的段落不必先標示姓名,但文字順序應與錄音一致。



開啟 AI 講者分段並設定人數


在「文字分段方式」中選擇「AI 標記講者並按不同說話的人分段文字」,再設定影片中的說話總人數。人數設定越接近實際情況,系統越容易維持一致的講者標籤。



  • 以主要發言者為準,短暫插話者可在完成後人工調整
  • 音訊中若有旁白、主持人與來賓,請分別計入講者人數
  • 先確認語言與 TXT 內容正確,再開始處理,可減少後續重做


Step 3:校對逐字稿並替換講者姓名


轉錄完成後,先播放幾個不同段落,確認文字、時間軸與講者切換是否一致。點選講者標籤,即可把系統產生的發聲者名稱改成 Amy、Steven、主持人或受訪者等實際身分;同一講者的其他段落也能以一致名稱呈現。



校對時優先檢查這三類片段


  • 兩位講者快速交替或彼此重疊的段落
  • 背景音、遠端連線或音量突然改變的位置
  • 片頭、片尾旁白,以及只短暫出現的發言者

說話者辨識的重點是先建立可用的初稿,再由熟悉內容的人做最後確認。姓名、職稱與專有名詞都應在匯出前校對,避免錯誤沿用到會議紀錄或正式字幕。



Step 4:匯出逐字稿或字幕檔


完成文字與人物標記後,開啟匯出選單,依用途選擇 TXT 等逐字稿格式,或匯出 SRT 字幕檔。若下一步要把內容放回影片,可使用自動上字幕工作流程繼續校對、翻譯或輸出影片。



  • TXT:適合會議紀錄、訪談整理與內容引用
  • SRT:保留字幕文字與時間碼,適合影片平台或剪輯流程
  • 匯出前:再次抽查講者姓名、文字內容與時間軸


常見問題:如何讓說話者辨識結果更好?


講者人數一定要完全正確嗎?


建議填寫實際的主要講者人數。若不確定,可先計算整段內容中持續發言的人;只在開場短暫出聲的人,可視內容重要性決定是否納入,並在完成後人工修正。


匯入 TXT 後,還需要校對嗎?


需要。TXT 解決的是文字來源,AI 還要把文字對齊音訊並判斷講者切換。重疊發言、背景噪音與遠端收音都可能影響結果,因此正式交付前仍應抽查。


哪些情境最適合使用人物標記?


多人會議、研究或客戶訪談、Podcast 對談、線上課程與座談會都很適合。清楚的講者標籤能讓讀者快速追蹤對話,也方便團隊搜尋決策、引用發言,或把逐字稿繼續製作成字幕。



結語:先分清誰在說話,再整理逐字稿


逐字稿說話者辨識能把連續文字整理成有講者、有段落、有時間軸的內容。依序完成影音匯入、TXT 上傳、AI 講者分段、人物命名與格式匯出,就能建立更容易校對與使用的逐字稿。


如果你經常處理會議、訪談或 Podcast,可直接體驗 Taption 的說話者辨識流程;先用 AI 建立結構化初稿,再由熟悉內容的人完成最後校對,會比從頭手動標記更適合持續性的影音工作流程。