語音轉文字名詞解釋|AIMochi

語音轉文字名詞解釋

逐字稿、講者識別、聲紋、SRT⋯⋯把錄音變成筆記的過程中,會遇到不少聽起來很像、實際上不同的專有名詞。這頁用最短的篇幅解釋 6 個最常見的名詞,並說明它們在 AIMochi 裡分別對應到哪個功能。

逐字稿(Transcript)

逐字稿是把一段語音內容依照原話、逐句轉寫成文字的紀錄,目標是忠實保留說話者實際說出的內容,而非改寫或濃縮。它與「會議紀錄」不同:會議紀錄是經過整理、只保留結論與待辦事項的摘要文件,而逐字稿保留完整發言脈絡,通常會附上時間碼與講者標記,作為後續整理的原始素材。訪談研究、法律與醫療紀錄、影音字幕製作都仰賴逐字稿。

在 AIMochi 中:把錄音檔傳給 AIMochi 後,系統產出的第一份成果就是逐字稿,之後才在它之上做摘要與潤飾。完整流程可參考〈會議逐字稿怎麼做?從錄音到會議紀錄的完整流程〉。

語音轉文字(Speech-to-Text, STT)

語音轉文字(Speech-to-Text,簡稱 STT)是由電腦自動將語音訊號辨識並轉換成對應文字的技術,也常稱為自動語音辨識(Automatic Speech Recognition, ASR)。現代 STT 系統多以深度學習模型直接從聲音波形學習到文字的對應關係,辨識品質會受到錄音清晰度、背景噪音、口音與專有名詞密度影響。STT 是逐字稿、即時字幕與語音助理的共同底層技術。

在 AIMochi 中:AIMochi 的語音轉文字支援超過 99 種語言,涵蓋中、英、日、韓與東南亞語系。支援的錄音格式與上傳方式請見常見問題

講者識別(Speaker Diarization)

講者識別(Speaker Diarization)是在一段多人對話的錄音中,自動判斷「什麼時間、由哪一位說話者發言」,並把每段語音分配給不同講者的技術。它回答的是「誰在什麼時候說話」,而不是「說了什麼」——後者是語音轉文字的工作,兩者結合才會得到標註了發言者的逐字稿。講者識別預設不需要事先知道說話者的身分,因此輸出通常是「講者 A、講者 B」這類匿名標籤。

在 AIMochi 中:AIMochi 會自動將對話標註為講者 A、B、C⋯⋯,最多支援 10 位講者。實務上如何提高辨識準確度,可參考〈會議逐字稿怎麼做?從錄音到會議紀錄的完整流程〉。

聲紋辨識(Voiceprint Recognition)

聲紋辨識(Voiceprint Recognition)是根據每個人嗓音的個別聲學特徵,判斷說話者身分的技術,屬於生物特徵辨識的一種。系統會從語音中抽取一組代表個人音色特性的數值向量(聲紋特徵),再比對兩段語音的向量是否足夠相似。它與講者識別的差別在於目的:聲紋辨識要確認「這是誰」,講者識別只需要區分「這幾段話是不是同一個人說的」,而後者在技術上正是以聲紋特徵的相似度作為分群依據。

在 AIMochi 中:AIMochi 以聲紋技術區分錄音中的不同發言者,這正是講者標記能自動產生的原因。

AI 摘要(AI Summarization)

AI 摘要(AI Summarization)是由語言模型自動閱讀一段較長的文字,並產生保留主要資訊、篇幅明顯較短的濃縮版本。摘要方式可分為兩類:抽取式摘要直接挑選原文中最具代表性的句子,生成式摘要則以自己的話重新組織內容,現行的大型語言模型多屬後者。應用在會議情境時,摘要通常會進一步結構化為決議事項、待辦事項與負責人。

在 AIMochi 中:逐字稿完成後,可直接使用摘要生成、筆記潤飾、多語言翻譯與智慧問答等 AI 功能。各項功能說明請見使用教學

字幕檔(SRT Subtitle File)

SRT 字幕檔是一種純文字的字幕格式,副檔名為 .srt,內容由多個字幕區塊組成,每個區塊包含序號、起訖時間碼與該段要顯示的文字。時間碼寫成「時:分:秒,毫秒」並以箭號連接起訖時間,區塊之間以空行分隔。因為格式單純、幾乎所有播放器與影音平台都支援,SRT 是目前最通用的外掛字幕格式。

在 AIMochi 中:語音筆記輸出時可選擇單句條列、合併語句與字幕檔三種格式,其中字幕檔即可直接用於影片上字幕。

還想知道更多?看看 常見問題使用教學,或到部落格閱讀語音轉文字與會議筆記的實務文章。