影片轉逐字稿:準確度取決於什麼?中文語音辨識的實際限制
逐字稿其實比字幕更值錢
大部分人想到語音轉文字,第一個念頭是字幕。但字幕只是逐字稿的其中一種用途,而且是價值比較低的那一種。
同一份逐字稿可以變成:
- 社群貼文:一支十分鐘的訪談,通常藏著三到五個能單獨成立的觀點
- 部落格文章:口語稿整理過就是一篇文,而且比對著空白畫面硬寫容易得多
- 電子報內容
- 內部知識庫:教育訓練影片轉成文字才搜尋得到
- 會議紀錄與待辦事項
換句話說,錄一次、寫十次。真正的槓桿在這裡,不在字幕。
準確度取決於四件事
一、收音品質
這是影響最大的一項,而且沒有任何模型能救。手機隔著兩公尺錄的會議,和領夾麥克風貼著講者錄的口播,出來的結果是兩個世界。
如果你只能改善一件事,改善收音,不要改模型。
二、模型大小
中文的辨識難度高於英文——沒有詞間空格、同音字多、聲調會被口音吃掉。英文用小模型堪用,中文用小模型會錯到不能看。
實務上中文一定要用中等以上的模型。速度會慢一些,但校對時間省下來的遠比跑的時間多。
三、有沒有先給提示
多數語音辨識模型可以接受一段「提示詞」,先告訴它這支影片會出現哪些專有名詞。有給和沒給,品牌名與術語的正確率差很多。
這一步幾乎零成本,卻常常被跳過。
四、口音與語速
台灣國語、混雜台語詞彙、中英夾雜(「我們先 review 一下這個 case」)——這些在中文語音辨識裡都是難題。中英夾雜尤其容易出錯,模型會在兩種語言之間猶豫。
會議錄影該不該上傳雲端
這是很多人沒想過、但一旦想過就回不去的問題。
會議錄影裡有什麼?客戶名字、報價數字、內部人事、還沒公開的計畫、有時候還有個資。把這種檔案上傳到一個你沒看過條款的線上服務,等於把公司的內部資訊交給第三方。
判斷標準很簡單:如果這支影片外流你會出事,就不要上傳。
本地處理的價值在這裡。檔案從頭到尾都在自己的機器上,沒有任何一段離開過。對律師事務所、診所、顧問公司、還有任何簽了保密條款的專案,這不是加分項,是門檻。
怎麼把校對時間壓到最短
AI 跑完不等於做完。逐字稿一定要人看過,問題是怎麼看得快。
錯的做法:從頭讀到尾,逐句比對。這跟自己重打差不了多少。
對的做法:讓工具把「模型自己也不確定的句子」標出來,人只看那幾句。
語音辨識模型在輸出每一段時,其實知道自己有多少把握。信心低的段落集中起來通常只佔全文的一到兩成,而錯誤幾乎都藏在那裡面。只看那一到兩成,校對時間直接砍掉大半。
再加上一份專有名詞的對照表做定向替換,剩下要人判斷的就很少了。
標點與分段:機器最不擅長的部分
即使字都對,斷句和標點還是常常怪怪的。原因是口語本來就沒有標點——講話的人用停頓和語氣分句,模型只能猜。
實務上會遇到的狀況:
- 一整段沒有句號,讀起來喘不過氣
- 該用問號的地方用句號
- 語助詞全部保留(「那個」「就是」「然後」)
前兩項可以用語言模型做一次後處理修掉。第三項要看用途——做字幕要清掉,做逐字紀錄(例如訪談研究、法律用途)反而必須原樣保留。
所以「要不要清語助詞」是交件前一定要先問清楚的事,不是預設值的問題。
一份好的逐字稿交付長什麼樣
不只是一個文字檔。實務上該有:
- 純文字版:清過語助詞、分好段,可以直接拿去改寫成文章
- 帶時間戳版:每一段標上時間,方便回頭核對原音
- SRT 字幕檔:要上字幕時直接用
- 校稿標記:把信心低的句子標出來
有這四份,後面不管要做什麼都不用重跑。
想試試看?
這套流程不難搭,重點是想清楚「逐字稿要拿來做什麼」再決定怎麼交付——要改寫成文章、要存進知識庫、還是要當會議紀錄,需要的格式完全不同。
客脈 AI 做的是同一類的事:把重複、耗時的流程交給 AI,先免費評估再談怎麼做。免費聊聊