AI 有聲書製作流程:從稿子到可上架的 7 個階段完整指南

AI 有聲書製作流程:從稿子到可上架的 7 個階段完整指南

用 AI 做有聲書,最容易失敗的地方不是「做不出來」,而是做出來之後才發現不能聽——換角色就變調、長段落會喘、一章做三小時還要全部重來。

這篇講製作端的完整流程:從拿到稿子,到可以交付上架。跟《上架流程》那篇互補,那篇講怎麼賣,這篇講怎麼做。

AI 有聲書製作完整流程

先說結論

你會遇到的問題 解法
角色聲音都一樣 一個角色一個聲音,固定不換
長段落會喘 每段切 3~5 句
一改稿全部重做 分章存檔,逐章重做
聽起來很平 旁白與角色分開處理
做到一半沒電 每章獨立存檔,不貪多

一句話: 有聲書要一章一章做,不要想著一次做完整本。

為什麼有聲書特別難?

短影音 60 秒錯了,重做 60 秒。
有聲書一章 20 分鐘錯了,重做 20 分鐘。

所以有聲書的核心不是「生成」,是降低重做的成本。

具體來說有四個難點:

  1. 長度:短影音幾十秒,有聲書一集幾十分鐘
  2. 角色:多角色對話,每個角色要不同聲
  3. 一致性:第一章和第十章的旁白要聽起來同一人
  4. 耐心:一本書可能要做幾十小時

延伸:AI 多角色對話配音。

階段 1:拿到稿子先做「可聽化」處理

AI 不能直接吃你隨手寫的稿。拿到文字後,先整理。

處理項目

項目 怎麼處理
標題層級 轉成「第一章」「第一節」
註腳與參考文獻 拿掉,會被唸出來
表格與圖片說明 改成口語描述
破音字 改同音字或標注
英文縮寫 第一次出現寫全名
數字與日期 寫成好唸的形式
超長句 拆成 2~3 句

最重要的兩件事

  1. 拿掉所有括號註記
    很多工具會把括號裡的內容也唸出來。

  2. 數字寫成中文
    「1,200 元」→「一千二百元」,不然會唸得很怪。

階段 2:決定聲音策略

這是有聲書和一般配音最大的差別。

三種策略

策略 A:一個聲音講全書

  • 適合:單人敘述書、非小說
  • 優點:簡單、快
  • 缺點:像在讀稿

策略 B:旁白 + 主要角色

  • 適合:多數小說
  • 優點:聽感自然
  • 缺點:要測試每個聲音是否穩定

策略 C:每個角色一個聲音

  • 適合:角色多的群像小說
  • 優點:最像真實有聲書
  • 缺點:工作量大,聲音要多

怎麼選?

先問:這本書聽起來應該像什麼?

  • 像在講故事 → 策略 B 或 C
  • 像在上一堂課 → 策略 A
  • 角色超過 5 個 → 先用 B 做第 1 章測試

階段 3:先測一章,不要開始做整本

這是最重要的一條規則。

測試章的檢查項目

  1. 前 5 分鐘有沒有走神
  2. 角色切換聽不聽得出來
  3. 長段落會不會喘
  4. 專有名詞唸對了嗎
  5. 整章長度會不會失控

測試章通過標準

  • 你自己願意聽完(真的,不是勉為其難)
  • 沒有想跳過的段落
  • 角色沒有搞混
  • 沒有明顯的機械感段落

沒通過就改策略,不要一邊做一邊改。

階段 4:分章製作與存檔

檔案結構怎麼排

建議這樣存:

  • 每章一個資料夾
  • 資料夾裡放:原稿、生成音檔、修改版、修訂版
  • 整本書有一個總目錄

為什麼要這樣

改稿的時候你只需要重做那一章,不用碰其他章。
有聲書最花時間的就是重做,這個結構直接省時間。

命名規則

用「第01章_旁白_v1」這種格式。
不要用「最終版」「真的最終版」——你會後悔的。

延伸:配音與音樂混音。

真人 vs AI:有聲書怎麼選?

不是所有書都適合用 AI。這篇幫你分清楚。

適合用 AI 的書

  1. 非虛構:教學、科普、傳記類,敘述性強
  2. 已被驗證的類型:讀者知道自己在聽什麼
  3. 你自己擁有或已取得授權的文字
  4. 主要目的是內容傳遞,不是演技
  5. 大量重製需求:例如把舊書做成有聲版

不適合用 AI 的書

  1. 演技是核心的戲劇小說:角色情緒轉折多
  2. 多人對話密度極高:超過 8 個主要角色
  3. 需要重現真實人物說話:涉及肖像與倫理
  4. 文學性作品:聽眾在聽「文字的質感」
  5. 平台明確禁止的內容

混合做法(實務上最常用)

內容 用什麼
旁白與解說 AI
重要對話 真人配音
片頭片尾與宣傳 AI
重點台詞 真人

好處是既有量產速度,又保留關鍵戲劇張力。
缺點是要管理兩種音檔的音量一致性。

延伸:AI 配音與真人配音比較。

讓 AI 有聲書聽起來更好:6 個細節

1. 章節開頭加 1 秒停頓

聽眾需要一個「換章」的訊號。空白轉場比無停頓好。

2. 對話前留一點空間

對話之間停 0.5~1 秒,會更像真的在對話。
太黏會讓人分不清誰在說話。

3. 重要句子可以拆兩段

同一個意思寫成兩段,中間換氣,聽起來更有力。

4. 不要整本書同一個音量

有些工具長文會越到後面越輕。
每章輸出後檢查音量,必要時統一。

5. 每章開頭與結尾手動修

AI 生成的第一句與最後一句最容易有雜訊。
花 5 分鐘修掉。

6. 建立「標準示範章」

挑一章做到你滿意,存起來當參考。
之後每一章都跟它比。

常見退貨原因與預防

退貨原因 預防做法
前 5 分鐘太無聊 開場不要從背景開始講
人名唸錯 專有名詞清單逐字確認
音量忽大忽小 每章統一處理
章節順序錯 上傳前依目錄核對
有背景雜訊 檢查每章開頭 5 秒
時長與預估差太多 先估字數 ÷ 語速

一個務實的專案排程範例

假設 12 萬字、10 章:

階段 天數 工作
稿子可聽化 2 天 分章與數字整理
測試章 1 天 生成與檢查
正式製作 10 天 每章 1 天
潤稿與一致性 3 天 逐章檢查
交付 1 天 整理與上傳

約 17 天完成。
若你是全職做,可能更快;若兼職,就照這個倍數放大。

階段 5:長段落的處理技巧

分段規則

  • 每段 3~5 句
  • 每段之間留一個空行
  • 對話段落一行一句

換氣在哪裡?

人講話會在這些地方換氣:

  • 句號之後
  • 逗號長停頓處
  • 段落開頭

如果你生成時聽起來很趕,通常是段落太長,不是工具問題。

對話怎麼標記

用角色名標記,讓系統知道切換:

【旁白】他推開門。 【小明】你終於來了。 【旁白】雨聲很大。

延伸:多角色對話配音。

階段 6:潤稿與一致性檢查

做完一章,檢查四件事。

1. 專有名詞一致性

人名、地名、品牌名全書要一樣。
如果有兩種唸法,觀眾會以為是不同的人。

2. 數字一致性

同一個金額、日期,全書寫法要統一。

3. 情緒一致性

同一個角色在不同章 shouldn’t 忽冷忽熱。

4. 音量一致性

每章的音量要一樣。
有的章大聲、有的章小聲,聽起來像換人錄。

專案管理:三個文件就夠

有聲書專案不需要複雜工具,三份文件就能維持秩序。

文件一:角色對照表

角色 聲音設定 備註
旁白 沉穩男聲 全書固定
小明 年輕男聲 語速略快
媽媽 溫和女聲 偏慢

這份表的功能是:換人接手時不會亂。

文件二:專有名詞清單

列出所有人名、地名、品牌、專有名詞與它們的固定寫法。
生成前先檢查一次,避免整章重做。

文件三:進度表

章 狀態 日期
第 1 章 已完成 —
第 2 章 已潤稿 —
第 3 章 已生成 —
第 4 章 進行中 —

狀態只要五種:未開始/進行中/已生成/已潤稿/已完成。

階段 7:交付前的最後檢查

檢查 標準
沒有長停頓或空白 聽前 3 分鐘
沒有唸錯的專有名詞 對照原稿掃一次
章節順序正確 依目錄核對
總長度合理 對照字數估算
有聲音樂版與純人聲版 依平台需求
檔名正確 依平台命名規則

延伸:AI 有聲書上架流程。

時間怎麼抓?(真實感)

假設一本書 10 萬字,約 8~10 萬字的中文語速。

階段 第一次 熟手之後
稿子整理 2~3 小時 1 小時
測試章 1~2 小時 30 分鐘
每章生成 20~40 分鐘 15~25 分鐘
每章潤稿 20 分鐘 10 分鐘
整本書 約 30~50 小時 約 20~30 小時

重點:第一次做的時間,不要拿來承諾交期。

工具怎麼選?

你需要… 找什麼
長文穩定 不會在段落結尾變虛
多角色 一個稿子多個聲音
中文本土 台灣腔、語助詞自然
可商用 授權清楚、能上架

延伸:2026 免費中文 TTS 比較、定價。

常見問題 FAQ

AI 有聲書會不會被平台拒收?

多數平台要求原創與授權清楚。用 AI 生成通常可以,但你要遵守平台當下的規則,並且不能拿未授權的克隆。

一本書要多久?

10 萬字大約 20~50 小時,看複雜度。第一次會比較久。

一定要用克隆嗎?

不一定。單人敘述書用內建好聲音就可以。

角色太多怎麼辦?

先做策略 B(旁白 + 主要角色),測試通過再決定要不要升級到 C。

會不會被聽出來是 AI?

短篇很難聽出來;長篇如果沒有潤稿,很容易被發現。關鍵在一致性與情緒。

成本大概多少?

延伸:AI 配音成本控制。

一句話收斂

AI 有聲書的重點: 先測一章、分章存檔、長段落切短。
降低重做成本,比追求一次到位重要。

現在就可以做的事

  1. 拿一章稿子出來
  2. 做完「可聽化」處理
  3. 測試章生成一次,完整聽完
  4. 通過了,再排整本計畫

延伸閱讀


最後更新:2026 年 9 月。各平台規則可能調整,請以當下官方規範為準。

分享這篇文章
XFacebookLINE