上個月,一個做 Podcast 的朋友問我:「你們用 AI 配音,聽的人不會覺得假嗎?」我問他最近聽過哪幾段 AI 語音,他舉的例子全是導航報路——五六年前的東西。
我沒有怪他。做旁白這兩年我發現,大家對文字轉語音的印象,多半來自很舊的樣本、別人的轉述,或者某一次剛好踩雷的經驗。我自己以前也信過其中三條,後來一條一條被實驗打臉。
這篇把十個最多人誤解的觀念攤開來講,每條都是「迷思、真相、實證」三段式,例子全部來自我做過的案子。先看總表:
- AI 聲音一定很假——你聽的可能是三年前的引擎
- 免費的和付費的聽起來差不多
- 用 TTS 會被平台判定低質內容(最常嚇到客戶的一條)
- TTS 只適合懶人
- TTS 會完全取代配音員
- AI 語音沒有版權問題
- 給幾秒樣本,什麼聲音都能 clone
- 中文多音字早就處理好了
- TTS 不需要改稿,貼上就好
- 長文直接丟進去就能聽
聽感迷思:假不假,不是引擎一個人決定的
迷思一:AI 聲音一定很假。 真相是:短句加乾淨稿,多數人已經分不出來。我做過一次盲測,把六十秒的產品介紹用 AI 和真人各配一版,找二十個人聽,十三個猜錯——其中五個還堅信 AI 那版才是真人。 但反例同樣好找:稿子一出現長串數字、生僻專有名詞、超過四十字沒標點的長句,破綻馬上現形。所以正確的問法不是「AI 假不假」,而是「你在什麼稿、什麼場景下用它」。
迷思二:免費的和付費的聽起來差不多。 前十秒真的差不多,撐到兩分鐘就不一樣了。我拿同一份八百字的稿,測過三個免費引擎和一個付費方案:
| 比的項目 | 免費引擎 | 付費方案 |
|---|---|---|
| 前十秒聽感 | 及格 | 及格 |
| 兩分鐘後的節奏 | 兩個出現句尾掉音 | 穩定 |
| 數字與英文混排 | 常唸錯 | 偶爾 |
| 商用授權 | 多數不附 | 通常附帶 |
免費的問題從來不是「難聽」,是「不穩定」——你永遠不知道它會在第幾分鐘掉鍊子。而且免費方案的商用授權常常寫得很含糊,等出事了才發現條款裡早就寫好了。

平台迷思與心態迷思
迷思三:用 TTS 會被平台判定低質內容。 平台判的是留存和內容價值,不是音檔來源。實證很直接:我兩支全程 AI 旁白的影片,分別跑到八萬和二十四萬觀看;同期一支找真人錄的,因為前五秒太拖,停在三千。 真正會被限流的是罐頭腳本、無腦搬運、音量忽大忽小。AI 聲音只是這些問題裡最容易被拿來怪罪的一項——觀眾說「這影片很水」的時候,不會說「因為旁白是合成的」。
迷思四:TTS 只適合懶人。 懶人拿什麼工具都懶。我觀察到的真實情況反過來:用 TTS 的人改稿次數更多,因為改稿比重錄便宜,人就會一直改下去。 我自己就是證據。第一年我以為貼上就好,成品被客戶退了四次;第二年學會為 TTS 改稿——數字中文化、長句切開、標點當情緒開關——同一個引擎,一次過稿。省下的不是錄音時間,是來回溝通的三天。
取代配音員?那版權呢
迷思五:TTS 會完全取代配音員。 它取代的是「量大、價低、時間緊」那一段:五十支產品短片的旁白、每天要更新的課程內容。高單價品牌片、要情緒表演的有聲書,真人仍是主流。 我一個配音員朋友,今年接案量沒降,單價還漲了兩成。他的說法是:簡單案子變少,難案子變多,市場上多的是「非真人不可」的活。分工正在發生,不是清零。
迷思六:AI 語音沒有版權問題。 聲音其實有三層,混在一起談才會出事:
- 引擎內建聲音:看平台授權條款,多數可商用,但要看清楚是「平台授權」還是「可轉授權」。我遇過一個方案,做自家案子可以,拿去當投放素材不行。
- 你自己的聲音 clone:要有明確授權流程,通常得錄指定句子做驗證。
- 別人的聲音拿去 clone:在多數地區已經直接踩到法律線,不只是道德問題。這兩年公開的求償案例早就不是新聞。
技術迷思:clone 與多音字
迷思七:給幾秒樣本,什麼聲音都能 clone。 十秒樣本能 clone 出「像個大概」;要到穩定、情緒可控、長文不崩的可用等級,通常要幾分鐘乾淨樣本,商用級要幾小時。而且素材品質有底線:背景有音樂、經過壓縮、語氣單一的樣本,做出來就是一團糊。 我用一段八秒的短影片音檔 clone 過自己,前兩句很像,第三句開始變調。改用三分鐘的麥克風錄音重做,才過得了我自己那關。
迷思八:中文 TTS 處理多音字沒問題。 常用詞沒問題,一離開常用詞就開始擲骰子。「行行出狀元」唸成 hang hang,只是基本款。 我統計過自己的翻車檔,多音字佔了快一半,熱門字是行、重、長、樂、還。解法不是換引擎,是改寫:換同義詞,或加標點逼它重新斷句。沒有任何引擎能完全免疫,差別只是機率高低。
流程迷思:改稿與長文
迷思九:TTS 不需要改稿。 口語稿和書面稿是兩種文體,把部落格文章直接貼進去,等於要演員照說明書演哭戲。 同一個引擎我做過對照:未改稿的版本平均重生成 3.4 次才可用,改過稿的只要 1.2 次。 原稿:「本產品採用先進之多層防護機制,可有效保障使用者之資訊安全。」 改後:「資料是鎖起來的。就算有人半路攔下來,看到的也只是一堆亂碼。」 差別不在字數,在於一句話有沒有呼吸。
迷思十:長文直接丟進去就能聽。 三千字一次生成,中後段一定會漂。我做過一支十二分鐘的有聲文章,一次生成出現四處語氣斷層,全部落在轉折句上。 我的做法:切成五百到八百字一段分批生成,段與段自己接呼吸,再把不順的兩三句重配。多花八分鐘,完聽率從 41% 提到 57%。順手也把網址、符號清一清,這類東西在長文裡出現的頻率比你想的高。長文不是不能丟,是不能「一次」丟。
回到那個問題
現在回到我朋友那句「聽的人不會覺得假嗎」。我的回答是:前五秒決定,不是音源決定。十條迷思拆完,指向的其實是同一件事——TTS 既不是按一下就完事的魔法,也不是一眼假的玩具;它是個照實執行你稿子的工具,稿好它就好,稿爛它就爛。
我平常就在 Soundwaver 的文字轉語音頁測新聲音和各種怪稿子;想認真比較免費付費的界線,價格頁寫得比我這篇清楚。與其繼續猜,不如丟你最熟的三百字進去,聽一次就知道哪幾條該丟掉了。


