用 AI 做有聲書,最容易失敗的地方不是「做不出來」,而是做出來之後才發現不能聽——換角色就變調、長段落會喘、一章做三小時還要全部重來。
這篇講製作端的完整流程:從拿到稿子,到可以交付上架。跟《上架流程》那篇互補,那篇講怎麼賣,這篇講怎麼做。

先說結論
| 你會遇到的問題 | 解法 |
|---|---|
| 角色聲音都一樣 | 一個角色一個聲音,固定不換 |
| 長段落會喘 | 每段切 3~5 句 |
| 一改稿全部重做 | 分章存檔,逐章重做 |
| 聽起來很平 | 旁白與角色分開處理 |
| 做到一半沒電 | 每章獨立存檔,不貪多 |
一句話: 有聲書要一章一章做,不要想著一次做完整本。
為什麼有聲書特別難?
短影音 60 秒錯了,重做 60 秒。
有聲書一章 20 分鐘錯了,重做 20 分鐘。
所以有聲書的核心不是「生成」,是降低重做的成本。
具體來說有四個難點:
- 長度:短影音幾十秒,有聲書一集幾十分鐘
- 角色:多角色對話,每個角色要不同聲
- 一致性:第一章和第十章的旁白要聽起來同一人
- 耐心:一本書可能要做幾十小時
延伸:AI 多角色對話配音。
階段 1:拿到稿子先做「可聽化」處理
AI 不能直接吃你隨手寫的稿。拿到文字後,先整理。
處理項目
| 項目 | 怎麼處理 |
|---|---|
| 標題層級 | 轉成「第一章」「第一節」 |
| 註腳與參考文獻 | 拿掉,會被唸出來 |
| 表格與圖片說明 | 改成口語描述 |
| 破音字 | 改同音字或標注 |
| 英文縮寫 | 第一次出現寫全名 |
| 數字與日期 | 寫成好唸的形式 |
| 超長句 | 拆成 2~3 句 |
最重要的兩件事
-
拿掉所有括號註記
很多工具會把括號裡的內容也唸出來。 -
數字寫成中文
「1,200 元」→「一千二百元」,不然會唸得很怪。
階段 2:決定聲音策略
這是有聲書和一般配音最大的差別。
三種策略
策略 A:一個聲音講全書
- 適合:單人敘述書、非小說
- 優點:簡單、快
- 缺點:像在讀稿
策略 B:旁白 + 主要角色
- 適合:多數小說
- 優點:聽感自然
- 缺點:要測試每個聲音是否穩定
策略 C:每個角色一個聲音
- 適合:角色多的群像小說
- 優點:最像真實有聲書
- 缺點:工作量大,聲音要多
怎麼選?
先問:這本書聽起來應該像什麼?
- 像在講故事 → 策略 B 或 C
- 像在上一堂課 → 策略 A
- 角色超過 5 個 → 先用 B 做第 1 章測試
階段 3:先測一章,不要開始做整本
這是最重要的一條規則。
測試章的檢查項目
- 前 5 分鐘有沒有走神
- 角色切換聽不聽得出來
- 長段落會不會喘
- 專有名詞唸對了嗎
- 整章長度會不會失控
測試章通過標準
- 你自己願意聽完(真的,不是勉為其難)
- 沒有想跳過的段落
- 角色沒有搞混
- 沒有明顯的機械感段落
沒通過就改策略,不要一邊做一邊改。
階段 4:分章製作與存檔
檔案結構怎麼排
建議這樣存:
- 每章一個資料夾
- 資料夾裡放:原稿、生成音檔、修改版、修訂版
- 整本書有一個總目錄
為什麼要這樣
改稿的時候你只需要重做那一章,不用碰其他章。
有聲書最花時間的就是重做,這個結構直接省時間。
命名規則
用「第01章_旁白_v1」這種格式。
不要用「最終版」「真的最終版」——你會後悔的。
延伸:配音與音樂混音。
真人 vs AI:有聲書怎麼選?
不是所有書都適合用 AI。這篇幫你分清楚。
適合用 AI 的書
- 非虛構:教學、科普、傳記類,敘述性強
- 已被驗證的類型:讀者知道自己在聽什麼
- 你自己擁有或已取得授權的文字
- 主要目的是內容傳遞,不是演技
- 大量重製需求:例如把舊書做成有聲版
不適合用 AI 的書
- 演技是核心的戲劇小說:角色情緒轉折多
- 多人對話密度極高:超過 8 個主要角色
- 需要重現真實人物說話:涉及肖像與倫理
- 文學性作品:聽眾在聽「文字的質感」
- 平台明確禁止的內容
混合做法(實務上最常用)
| 內容 | 用什麼 |
|---|---|
| 旁白與解說 | AI |
| 重要對話 | 真人配音 |
| 片頭片尾與宣傳 | AI |
| 重點台詞 | 真人 |
好處是既有量產速度,又保留關鍵戲劇張力。
缺點是要管理兩種音檔的音量一致性。
延伸:AI 配音與真人配音比較。
讓 AI 有聲書聽起來更好:6 個細節
1. 章節開頭加 1 秒停頓
聽眾需要一個「換章」的訊號。空白轉場比無停頓好。
2. 對話前留一點空間
對話之間停 0.5~1 秒,會更像真的在對話。
太黏會讓人分不清誰在說話。
3. 重要句子可以拆兩段
同一個意思寫成兩段,中間換氣,聽起來更有力。
4. 不要整本書同一個音量
有些工具長文會越到後面越輕。
每章輸出後檢查音量,必要時統一。
5. 每章開頭與結尾手動修
AI 生成的第一句與最後一句最容易有雜訊。
花 5 分鐘修掉。
6. 建立「標準示範章」
挑一章做到你滿意,存起來當參考。
之後每一章都跟它比。
常見退貨原因與預防
| 退貨原因 | 預防做法 |
|---|---|
| 前 5 分鐘太無聊 | 開場不要從背景開始講 |
| 人名唸錯 | 專有名詞清單逐字確認 |
| 音量忽大忽小 | 每章統一處理 |
| 章節順序錯 | 上傳前依目錄核對 |
| 有背景雜訊 | 檢查每章開頭 5 秒 |
| 時長與預估差太多 | 先估字數 ÷ 語速 |
一個務實的專案排程範例
假設 12 萬字、10 章:
| 階段 | 天數 | 工作 |
|---|---|---|
| 稿子可聽化 | 2 天 | 分章與數字整理 |
| 測試章 | 1 天 | 生成與檢查 |
| 正式製作 | 10 天 | 每章 1 天 |
| 潤稿與一致性 | 3 天 | 逐章檢查 |
| 交付 | 1 天 | 整理與上傳 |
約 17 天完成。
若你是全職做,可能更快;若兼職,就照這個倍數放大。
階段 5:長段落的處理技巧
分段規則
- 每段 3~5 句
- 每段之間留一個空行
- 對話段落一行一句
換氣在哪裡?
人講話會在這些地方換氣:
- 句號之後
- 逗號長停頓處
- 段落開頭
如果你生成時聽起來很趕,通常是段落太長,不是工具問題。
對話怎麼標記
用角色名標記,讓系統知道切換:
【旁白】他推開門。 【小明】你終於來了。 【旁白】雨聲很大。
延伸:多角色對話配音。
階段 6:潤稿與一致性檢查
做完一章,檢查四件事。
1. 專有名詞一致性
人名、地名、品牌名全書要一樣。
如果有兩種唸法,觀眾會以為是不同的人。
2. 數字一致性
同一個金額、日期,全書寫法要統一。
3. 情緒一致性
同一個角色在不同章 shouldn’t 忽冷忽熱。
4. 音量一致性
每章的音量要一樣。
有的章大聲、有的章小聲,聽起來像換人錄。
專案管理:三個文件就夠
有聲書專案不需要複雜工具,三份文件就能維持秩序。
文件一:角色對照表
| 角色 | 聲音設定 | 備註 |
|---|---|---|
| 旁白 | 沉穩男聲 | 全書固定 |
| 小明 | 年輕男聲 | 語速略快 |
| 媽媽 | 溫和女聲 | 偏慢 |
這份表的功能是:換人接手時不會亂。
文件二:專有名詞清單
列出所有人名、地名、品牌、專有名詞與它們的固定寫法。
生成前先檢查一次,避免整章重做。
文件三:進度表
| 章 | 狀態 | 日期 |
|---|---|---|
| 第 1 章 | 已完成 | — |
| 第 2 章 | 已潤稿 | — |
| 第 3 章 | 已生成 | — |
| 第 4 章 | 進行中 | — |
狀態只要五種:未開始/進行中/已生成/已潤稿/已完成。
階段 7:交付前的最後檢查
| 檢查 | 標準 |
|---|---|
| 沒有長停頓或空白 | 聽前 3 分鐘 |
| 沒有唸錯的專有名詞 | 對照原稿掃一次 |
| 章節順序正確 | 依目錄核對 |
| 總長度合理 | 對照字數估算 |
| 有聲音樂版與純人聲版 | 依平台需求 |
| 檔名正確 | 依平台命名規則 |
延伸:AI 有聲書上架流程。
時間怎麼抓?(真實感)
假設一本書 10 萬字,約 8~10 萬字的中文語速。
| 階段 | 第一次 | 熟手之後 |
|---|---|---|
| 稿子整理 | 2~3 小時 | 1 小時 |
| 測試章 | 1~2 小時 | 30 分鐘 |
| 每章生成 | 20~40 分鐘 | 15~25 分鐘 |
| 每章潤稿 | 20 分鐘 | 10 分鐘 |
| 整本書 | 約 30~50 小時 | 約 20~30 小時 |
重點:第一次做的時間,不要拿來承諾交期。
工具怎麼選?
| 你需要… | 找什麼 |
|---|---|
| 長文穩定 | 不會在段落結尾變虛 |
| 多角色 | 一個稿子多個聲音 |
| 中文本土 | 台灣腔、語助詞自然 |
| 可商用 | 授權清楚、能上架 |
延伸:2026 免費中文 TTS 比較、定價。
常見問題 FAQ
AI 有聲書會不會被平台拒收?
多數平台要求原創與授權清楚。用 AI 生成通常可以,但你要遵守平台當下的規則,並且不能拿未授權的克隆。
一本書要多久?
10 萬字大約 20~50 小時,看複雜度。第一次會比較久。
一定要用克隆嗎?
不一定。單人敘述書用內建好聲音就可以。
角色太多怎麼辦?
先做策略 B(旁白 + 主要角色),測試通過再決定要不要升級到 C。
會不會被聽出來是 AI?
短篇很難聽出來;長篇如果沒有潤稿,很容易被發現。關鍵在一致性與情緒。
成本大概多少?
延伸:AI 配音成本控制。
一句話收斂
AI 有聲書的重點: 先測一章、分章存檔、長段落切短。
降低重做成本,比追求一次到位重要。
現在就可以做的事
- 拿一章稿子出來
- 做完「可聽化」處理
- 測試章生成一次,完整聽完
- 通過了,再排整本計畫
延伸閱讀
最後更新:2026 年 9 月。各平台規則可能調整,請以當下官方規範為準。

