把整本書變成有聲書:十萬字長文配音的穩定度實測

把整本書變成有聲書:十萬字長文配音的穩定度實測

文章轉音檔做熟之後,我開始膨脹了,覺得自己可以挑戰更難的:把一整本十萬字的內容,用 AI 做成有聲書。

結果第一個晚上就教我做人。短篇裡完全看不出來的問題,一拉到十萬字的長度,全部浮上來。語氣漂移、章節斷點、後製爆量,每一樣都夠我喝一壺。

這篇把我踩過的坑、最後磨出來的流程,老老實實記下來。如果你也想把長文、課程、甚至整本書做成音檔,這些經驗應該能幫你省下很多個晚上。

先說結論:短篇靠工具,長篇靠流程

三五千字的文章,你只要稿子寫好、丟進去,出來的東西通常能直接用。但十萬字的有聲書,光靠工具撐不住,你得自己搭一套「流程」:怎麼分段、怎麼保持聲音一致、怎麼後製,每一環都要有規矩。

沒有流程的人,會像我第一晚一樣,一口氣轉完全部,然後整晚都在收拾爛攤子。

第一個坑:三千字之後,語氣開始「飄」

這是我最早發現、也最困擾的問題。

同一段聲音,前三千字唸得中規中矩,過了某個點之後,語速、停頓、甚至音高都開始微微跑掉。單獨聽每一段都還好,但整本連著聽,就會覺得「怎麼越聽越不是同一個人」。

原因不難理解:模型處理超長文本時,前後的「語境」會互相拉扯。 後面的段落會不自覺受到前面內容的影響,節奏就越來越偏。

我的解法:把長文切成小段,一段一段餵。 我後來固定每段不超過一千五百字,段落之間用章節標題切開。這樣每一段都是獨立生成,語氣就穩定多了。代價是要多花時間一段段跑,但比起「整本重來」,這點時間划算太多。

第二個坑:分段要按「章」,不要按「字數」

一開始我偷懶,用「每兩千字切一刀」的方式分。結果災難。

因為硬切常常切在句子中間,或是把一個完整的段落拆成兩半。聽的人會突然被中斷,然後下一段又從半句話開始,完全對不上。

正確做法是:按內容的結構切。 一章一個檔案、一個小節一個檔案。切之前先掃一遍,確認每個斷點都在「自然收尾」的地方——一段話講完了、一個小標題結束了。寧可一段長一點、短一點,也不要切在中間。

我後來的心法是:把每一段當成一支獨立的短配音來做,再用「片頭片尾」把它們串起來。 這樣心態也輕鬆,品質也穩。

第三個坑:聲音一致性,從頭到尾不能換

這是長篇最容易被忽略、卻最致命的一點。

短篇裡你換個聲音無所謂,但一本十萬字的書,如果第三章突然變成另一個音色,聽的人會瞬間出戲,甚至以為是檔案壞了。

所以從第一天就要定死:整本用同一個聲音、同一組語速跟音高參數。 我會把這些參數記在專案的開頭,每一段都照抄,絕不手滑改動。中途想微調,就全部重跑,不要只改某一章。

還有一個細節:取樣率跟輸出格式也要統一。 前面 44.1kHz、後面 22kHz,接在一起會有明顯的密度落差。這些「看不見的小地方」,正是長篇品質的關鍵。

第四個坑:後製的量,比你想的大十倍

短篇後製可能就是去個雜音、調個音量。長篇的後製,是一整條流水線。

我踩過最痛的一次,是一口氣轉完全部十萬字,然後才開始後製。結果發現有幾段的音量忽大忽小、有幾段有口水音、片頭片尾完全沒有——等於要從頭再聽一遍,一個一個修。

後來我把後製拆成三關,邊做邊驗收:

第一關,去口水音跟雜訊。 每轉完一段就立刻處理,不要囤到最後。

第二關,統一音量。 用響度標準化(loudness normalization)把每段拉到一致的響度,避免段與段之間忽大忽小。

第三關,加片頭片尾跟過場。 每一章前面放一個簡短的章節標題音、結尾放一個小小的收尾音,聽的人才知道「這章結束了」。

我後製有聲書的工作畫面

我搞砸過的那個晚上

說來慚愧,我犯的錯幾乎都是「貪快」。

第一晚,我想說「一次轉完全部,明天就能上架」,於是把十萬字整包丟進去。等了很久,出來一大堆檔案,我興奮地開始聽——結果越聽越涼。語氣漂了、斷點亂了、音量不齊,最糟的是,我根本分不清哪一段對應哪一章。

那天晚上我學到兩件事:長篇沒有「一次到位」這種事,只有「一段一段做好」。 還有,檔案的命名,一定要在一開始就定好規矩,否則後悔莫及。

我現在的命名是「章節編號+章節名+段號」,例如「03-第三章-02.wav」。這樣不管檔案再多,我一眼就知道它是誰、該排在哪。

十萬字做完,我的帳

全部做完,前後大概花了我幾個晚上的零碎時間(轉檔加後製)。如果找真人配音員錄十萬字,費用跟時間完全是另一個量級,這是我選 AI 的根本原因。

但我也得老實說:AI 有聲書現在還到不了「專業錄音室」那個等級。 它能做到的是「乾淨、穩定、可聽、成本極低」,做不到的是「每一句都有戲」。如果你的書需要大量情感表演,AI 只能當底稿,關鍵章節還是建議找人。

對想「把內容變成音檔、讓更多人用聽的」這件事來說,AI 已經完全夠用,而且門檻低到嚇人。

給想開始的人的三個建議

如果你看完也想挑戰長篇,我給你三個很實務的建議。

第一,先從兩萬字開始,別直接衝十萬。 兩萬字剛好夠你把「分段、命名、後製」整條流程跑一遍,錯也錯得起。十萬字是你流程成熟之後的事。

第二,把參數跟命名規則寫在一張紙上。 聲音、語速、音高、取樣率、輸出格式、檔案命名,全部寫下來貼在螢幕邊。長篇最怕的不是難,是「中間忘了自己怎麼設定的」。

第三,留一份「每章檢查表」。 每做完一章,就勾一次:語氣有沒有漂、斷點對不對、音量平不平、片頭片尾有沒有。這份表能幫你在錯誤變大之前抓住它。

還有一件事很多人會忽略:備份。 十萬字拆成三十段,每一段都是心血。我會把原始稿、分段稿、生成檔、後製檔分成四個資料夾,各存一份。東西一多,最怕的就是「檔案找不到」或「不小心蓋掉」。多花三十秒備份,省下的是一整個晚上。

長篇沒有捷徑,但它有「流程」。流程對了,十萬字不過是把同一件事,重複做三十次。

想試試看

如果你只做到「文章轉音檔」,可以從 這篇三個月的通勤實測 開始;想搞懂長文為什麼會有這些極限,TTS 的原理 會給你答案。十萬字的大工程,其實就是幾百個「三千字」疊起來,把每一小段做好,整本自然就穩。

分享這篇文章
XFacebookLINE