影片自動上字幕怎麼做?繁中實測:三種做法、成本與踩雷
為什麼上字幕是最該自動化的一件事
拍一支三分鐘的口播影片,錄影可能只花十分鐘,上字幕卻要花一到兩小時。它不需要創意、不需要判斷,只需要耐心——這正是「重複勞動」的定義,也是最該交給 AI 的那一類工作。
而且字幕不是可有可無。多數人在通勤、辦公室、深夜滑手機時不會開聲音,沒有字幕的影片對他們等於不存在。字幕也讓聽力不便的觀眾看得懂,同時給平台一份可以理解你內容的文字。
三種做法,差在哪裡
一、手打
用剪輯軟體一句一句敲。品質最高、成本也最高。三分鐘的影片,熟手大概要四十分鐘到一小時。適合成品要求極高、而且量很少的情況。
二、線上字幕服務
上傳影片、等它跑完、下載字幕檔。速度快,但有三個代價:
- 檔案要上傳到別人的伺服器。 如果影片是客戶會議、內部教育訓練、還沒發表的產品,這一步本身就是風險。
- 按分鐘計費。 量一大就很有感。
- 繁體中文常常不是第一優先。 很多服務的中文模型以簡體語料為主,輸出會混進簡體字與中國用語。
三、本地 AI 轉錄
在自己的電腦上跑語音辨識模型,影片不離開本機。沒有單次費用、不用等上傳、隱私可控。代價是要有人把流程建起來,而且要懂得怎麼調參數。
繁體中文特有的三個坑
坑一:簡繁混雜
語音辨識模型的中文訓練語料以簡體居多,輸出常常簡繁混雜。這需要在流程最後做一次轉換,而且不能只做字元對應——「後面」和「皇后」的「后」在簡體裡是同一個字,機械式轉換一定會錯。
坑二:專有名詞
品牌名、人名、產品名、專業術語,模型沒聽過就會猜一個發音接近的詞。實務上要準備一份詞彙表,在轉錄完成後做定向替換,而不是期待模型自己猜對。
坑三:斷句
中文沒有詞與詞之間的空格,模型要自己決定哪裡斷句、哪裡下標點。斷錯的字幕讀起來非常累——一行三十個字沒有停頓,觀眾根本跟不上。字幕的行長要控制,通常一行不超過十五到二十個字。
最容易被忽略的一件事:模型大小
同一支影片,用小模型和大模型跑出來的結果差距非常大。英文用小模型堪用,中文一定要用中等以上的模型,否則錯字會多到「校對比重打還慢」。
這是很多人試用免費工具之後覺得「AI 上字幕根本不能用」的真正原因——不是 AI 不行,是模型選太小。
SRT 字幕檔,還是燒進畫面?
兩種都要,用途不同:
- SRT/VTT 字幕檔:上傳到 YouTube 後平台可以索引內容,觀眾能自己開關,之後要修改也容易。
- 燒進畫面的硬字幕:Instagram Reels、TikTok 這類平台,字幕直接烤進畫面才保證每個人都看得到,而且可以做字體與顏色設計。
實務上兩份都該交:燒好的成品影片,外加一份 SRT。
順序很重要:先剪空白,再轉錄
這是實作時最容易踩、也最難發現的一個雷。
口播影片通常會先剪掉停頓和空白,讓節奏變緊。如果你先轉錄字幕、再剪空白,字幕的時間軸就會全部錯位——畫面被剪短了,字幕的時間戳卻還是原始長度。
正確順序是:先剪空白 → 對剪好的影片轉錄 → 再上字幕。 順序顛倒的話,前面幾句還對得上,越到後面漂移越嚴重,而且很容易到最後預覽時才發現。
AI 上字幕最大的風險,不是錯字
錯字看得出來。真正危險的是翻譯。
如果影片是外語、要轉成中文字幕,流程通常是「語音辨識 → 翻譯」。當語音辨識聽錯一句,翻譯模型會把錯的原文翻成非常通順的中文——畫面上完全看不出破綻,只有懂那個語言的人對照原音才會發現。
所以合理的做法是:外語來源一律附一份校稿檔,把模型自己信心低的句子標出來請人核對。中文影片就沒這個問題,因為你自己聽得懂。
什麼樣的影片適合自動上字幕
適合:
- 口播、講課、教學影片
- Podcast 影音版
- 會議錄影、教育訓練
- 訪談(單人或雙人輪流講)
比較吃力:
- 多人同時講話、互相打斷
- 背景音樂蓋過人聲
- 收音品質差、空間有回音
- 大量專業術語又沒有提供詞彙表
一支影片實際要多久
用本地流程跑,一支三分鐘的口播影片大概是:轉錄一到兩分鐘、產字幕與合成一到兩分鐘,人工校對五到十分鐘。合計十分鐘上下,跟手打的一小時差了五倍以上。
真正花時間的永遠是校對,不是 AI 跑的那一段。所以流程設計的重點不是「讓 AI 更快」,而是讓校對更快——把不確定的句子標出來,讓人只看那幾句,而不是從頭讀一遍。
想直接把這件事交出去?
上面這些做法你都可以自己做起來,本地轉錄的工具是免費的。真正難的是流程設計——尤其是「先剪空白再轉錄」那個順序,弄反了字幕會漸進漂移,而且不會有任何錯誤訊息告訴你。
客脈 AI 做的是同一件事的放大版:把公司裡重複、耗時的流程交給 AI。先免費評估,再談怎麼做。免費聊聊