用 AI 配音做線上課程:我幫三個講師做配音的實戰筆記

用 AI 配音做線上課程:我幫三個講師做配音的實戰筆記

去年底一個朋友找我幫忙:他做了一門線上課程,三十個單元的逐字稿全部寫好了,但一想到要錄三十段旁白就整個卡住。他問我:「AI 配音可以用在課程上嗎?」

我跟他說:「我先幫你配三集試試,聽完你再決定。」

結果他聽完之後,當場決定全部三十集都用 AI 配。那門課程上架半年,超過兩千人報名,到現在沒有一個學生抱怨「聲音是假的」。

後來又有兩個講師找上來,型態完全不同:一個是簡報講解課程(畫面是投影片加旁白),一個是程式教學(畫面是螢幕操作加解說)。三種課程我都用 AI 配音做完,這篇把所有經驗整理出來。

為什麼線上課程特別適合 AI 配音

課程跟短影片最大的不同是「修改頻率」。

短影片拍完就完了,但課程內容會一直更新——新的 API 版本出來、新的法規通過、新的案例發生,你都要回去改。如果每改一次就要重錄一次旁白,那個成本是會累積的。我幫第一位講師做的課程,半年來改了七次內容,如果每次都真人重錄,光是排期和錄音就要花掉兩週的時間。用 AI 的話,改稿、重新生成、替換音檔,半天就搞定。

另一個原因是「一致性」。三十個單元,如果用真人錄,你很難保證每一集的音色、音量、情緒都一致——講師的狀態每天不同。但 AI 配出來的每一集,音色完全一致,聽起來就像同一次錄音,這種穩定感在課程裡特別重要,因為學生是連續聽的,任何不一致都會被放大。

第一種課程:敘述型(有聲書式)

第一個講師的課程是「職場溝通」,內容主要是講解概念和案例分析,像有聲書一樣一個人講到底。

這種課程的稿子最需要注意的是「斷句」。講師的書面稿通常很長,一句話動不動就超過四十字。我做的第一件事就是把所有長句拆成短句——每句不超過二十字,中間用逗號或句號斷開。拆完之後,AI 配出來的節奏馬上就不一樣了,從「唸稿」變成「講話」。

聲音選擇方面,我幫他選了一個溫和但不軟的聲音——太溫柔的聲音在長篇課程裡會讓人昏昏欲睡,太有力量的又會讓聽眾覺得在被訓話。折衷的做法是選一個「中性穩定」的聲音,然後在稿子裡用標點和句長來控制情緒起伏。

這一門三十個單元,我從收到逐字稿到全部配完,花了四天。如果用真人錄,講師自己估的是至少兩週。

第二種課程:簡報講解型

第二個講師的課程是「數據分析入門」,畫面是投影片,旁白跟著投影片走。

這種課程最大的挑戰是「節奏對齊」。旁白必須跟投影片的動畫時間對上——你講到第三張圖的時候,畫面要剛好切到那張圖。解法是我先在每張投影片上標好時間碼,然後照時間碼切稿子。例如第一張投影片預計停留四十秒,我就把對應的旁白控制在二十到二十五個字之間(中文語速約每秒五個字),留十五秒的空間給動畫和停頓。

另一個要注意的是「指代詞」。稿子裡寫「如圖所示」可以,但旁白裡你不能說「如圖所示」——聽眾聽不到「圖」。要改成「你們現在看到的這張圖,左邊是舊版、右邊是新版」。我花了半天把所有指代詞改完,這是準備稿子時最容易漏掉的步驟。

聲音方面,我選了一個偏中性的聲音,語速調到 1.05 倍——比正常稍微快一點,讓課程聽起來有推進感又不趕。太慢的語速在簡報課程裡會讓學生覺得「這段可以跳過」。

第三種課程:程式教學型

第三個講師教的是 Python,畫面是螢幕操作加語音解說。

這是最難的一種,因為程式教學的旁白有大量「專有名詞」和「程式碼片段」。AI 配音在處理這些的時候,常常會把變數名唸成普通英文單字,或者把 print() 唸成「印刷」。

我的解法很笨但有效:在逐字稿裡,把所有程式碼片段改成「你要它唸出來的樣子」。例如 print(“hello”) 改成「print 括號引號 hello 引號括號」,len() 改成「l-e-n 括號括號」。聽起來麻煩,但做完之後我建了一個「程式碼唸法對照表」,之後每一集照表抄就好,效率很高。

另一個坑是「等待時間」。程式執行需要時間,旁白不能一直講——你要留空白讓學生看螢幕。我的做法是在每段程式碼執行的畫面前留三到五秒的安靜,旁白在畫面切回來之後才繼續。這樣學生有時間消化,節奏也不會太趕。

三個共同的坑

三種課程做完,我歸納出三個所有人都會踩的坑。

第一,逐字稿不是旁白稿。講師的書面稿直接丟給 AI 配,聽起來一定會怪。一定要做「口語化」處理——把長句拆短、把書面詞換成口語詞、把所有聽眾看不到的東西(圖表、畫面動作)用文字描述出來。這個步驟大概佔整個流程百分之四十的時間,但不做這步,後面的品質全打折。

第二,不要一次配完。我一開始的流程是:收到全部逐字稿,一口氣配完三十集。後來發現錯誤率很高——前幾集踩的坑,到第十幾集才發現,後面的要全部重做。現在我改成:先配三集,跟講師確認品質,調整完之後再批量做。前面多花一天確認,後面少浪費三天重工。

第三,留修改空間。課程一定會改。如果第一版就全部用最好的聲音和最高的設定,之後升級就沒有空間了。我的做法是第一版用中等設定,確認內容正確之後再拉高品質重新生成——反正 AI 改稿的成本是零。

講師最常問的三個問題

「學生聽得出來是 AI 嗎?」我幫三個講師做過盲測:把 AI 配音的課程片段放給十個不知情的人聽,問他們「這是真人錄的還是 AI?」結果只有兩個人猜對,而且他們的理由是「太穩了,真人不會每一句都這麼穩」。資訊型課程,AI 配音目前完全夠用。

「之後改內容方便嗎?」這題最好答。改稿之後重新生成,音色完全一致,學生甚至不會發現你改過。真人重錄反而更容易被聽出來——因為前後兩次錄音的狀態不可能完全一樣。

「成本差多少?」以三十個單元、每集十五分鐘來算,真人配音的行情大約是每集兩千到五千元起跳,整門課的配音費用六萬到十五萬。AI 配音的月費方案,成本大概是真人的十分之一不到。差距很大,但前提是你的課程是「資訊型」——如果需要大量情緒表演的課程(例如演講訓練、聲音表達),我還是建議找真人。

給想用 AI 做課程的人

先做三集就好。收到逐字稿,口語化處理,配三集,拿給三個人聽。他們覺得 OK,再繼續做。這三集的投入,能幫你避開百分之八十的後續問題。

還有一個省時的做法:先用 AI 配完全部內容,確認內容無誤之後,最後再把開場和結尾那幾句用自己的聲音錄。這樣整門課有「人的溫度」在頭尾,中間是穩定的 AI 配音,學生的體驗是最好的。

想實際體驗 AI 配音在課程裡的效果,可以把你的逐字稿貼一段到 Soundwaver 的 Demo,選一個適合長篇內容的聲音配一次。聽完你就知道,這件事的門檻比你想的低太多了。

分享這篇文章
XFacebookLINE