搜「AI 配音」「文字轉語音」「中文 TTS 怎麼用」的人,通常不是想聽術語,只想知道:今天怎麼做出一支能用的旁白?
這篇是完整指南,約 3000 字。從寫稿、選聲音、生成、修錯、上片到授權,7 個步驟一次講完。你可以當成「AI 配音操作手冊」,照著做就能出第一支可用的影片旁白。

先說結論(30 秒版)
| 你的情況 | 建議 |
|---|---|
| 第一次做 | 先用 文字轉語音 跑 5 句真實稿 |
| 要像自己的聲音 | 走 聲音克隆 |
| 要台灣腔 | 看 台灣腔 AI 配音 |
| 只想試免費額度 | 先小段測,別一次生成 10 分鐘 |
| 要上 YouTube | 先看授權與原創性,再上片 |
一句話收斂: AI 配音好用的關鍵不在工具多高級,而在稿子像人講話、句子夠短、數字寫清楚。
AI 配音是什麼?為什麼大家都在用?
AI 配音(也叫文字轉語音、TTS、AI 朗讀)就是:
- 你寫字
- 系統讀字
- 輸出音檔
以前要配音,要約時間、進錄音室、NG 重來。
現在一支短片的旁白,可能只要幾分鐘就能出草稿。
它特別適合:
- 短影音:前 3 秒鉤子先試聽
- YouTube:固定開場、結尾、CTA
- 課程:改稿後重生成
- 有聲書:長篇量產
- 門市廣播:聲音統一
但它不是拿來假冒別人、也不是「丟亂寫的稿也會好聽」。
7 步做出能用的 AI 配音(照做清單)
步驟 1:先決定「這段聲音幹嘛用」
用途會決定你怎麼寫稿、選聲音、要不要商用授權。
| 用途 | 先確認 |
|---|---|
| 自己聽草稿 | 隨便 |
| YouTube 營利片 | 商用授權 |
| 廣告投放 | 條款更嚴 |
| 有聲書上架 | 平台規範 |
| 克隆自己 | 同意與素材 |
步驟 2:寫「像人在講」的稿
很多人第一步就寫成作文腔,AI 讀起來就會假。
太書面:
本日將為各位說明三項重點,敬請持續關注。
改成口語:
今天跟你講三個重點。記得訂閱,有更新我會說。
寫稿 6 個規則
- 一句一個意思(12~25 字最好)
- 少用成語與公文詞
- 數字寫成好唸的(3.5 萬 → 三萬五千)
- 語助詞照你平常講法寫(欸、齁、啦)
- 英文縮寫先標唸法(TTS → 可先寫「文字轉語音」)
- 段落之間留換氣(別 300 字一坨)
延伸:TTS 文案怎麼寫。
步驟 3:挑聲音(別只看頭像)
挑聲音聽四件事:
- 像不像你想要的人
- 語助詞自然嗎
- 數字對嗎
- 長句會不會喘
怎麼快速選?
步驟 4:先測 5 句,不要一次生成全片
這是最多人踩的雷:稿還沒驗,就按生成 10 分鐘。
先丟這 5 句:
- 「欸,等一下齁,這支片三分半就好。」
- 「今天這集,我會分享三個踩過的坑。」
- 「2026 年 3 月 15 日,業績成長 12.5%。」
- 「記得訂閱,留言告訴我你的做法。」
- 「這句是測試:三萬五千塊,會不會唸對?」
通過再放大。
步驟 5:生成、聽、修稿、再生成
常見翻車與急救:
| 問題 | 怎麼修 |
|---|---|
| 像在唸課本 | 改口語、加語助詞 |
| 數字亂掉 | 改寫中文數字或拆句 |
| 長句喘不過氣 | 分成兩句 |
| 情緒太平 | 加情緒標籤/導演指令 |
| 品牌名唸錯 | 換同音字或加註解 |
更多:AI 配音翻車圖鑑。
步驟 6:輸出與剪輯
- 旁白可先生成草稿,再跟畫面對時
- 重要 CTA(訂閱/購買)可自己補錄
- 存原始檔,別只留剪映裡的專案
步驟 7:上片前 60 秒檢查
- 授權夠不夠(商用/廣告)
- 數字、名詞有沒有錯
- 有沒有背景雜訊
- 有沒有抄襲風險(腳本原創)
- 片頭 3 秒會不會太慢
不同平台的「聽感」差在哪?
同一段旁白,放 YouTube、放 Reels、放課程,聽起來舒服的地方不一樣。
短影音(Reels/Shorts/TikTok)
- 速度偏快:觀眾隨時會滑走
- 句子更短:一句一個重點
- 開頭要鉤:前 3 秒沒有吸引力就沒了
- 避免大段解釋:觀眾先看畫面再聽你講
YouTube 長片
- 節奏可以慢一點:但要每 30~60 秒有一個「往下看的理由」
- 分段清楚:開場、重點、小結、CTA
- 聲音可稍後製:跟 BGM 音量比例要調
線上課程
- 清楚優先於戲劇:學生要聽得懂
- 術語第一次要講清楚:別假設大家都知道
- 每段有回顧句:幫記憶
有聲書
- 一致性最重要:不能上一段很熱情、下一段變新聞腔
- 章節邊界要穩:長文容易在段尾變虛
- 角色與旁白要分開:別全部同一個聲
門市/廣播
- 短、清楚、可重複聽:背景吵,咬字要用力一點
- 資訊密度低:一句一個指令
中文特有的 5 個坑(英文工具最容易踩)
- 語助詞被吞:「齁」「啦」「欸」不見或太假
- 輕聲不見:「什麼」「東西」字字重
- 數字:日期、百分比、金額
- 用詞:影片 vs 視頻、軟體 vs 軟件
- 破音字:長/長大、行/行走
急救包:AI 配音翻車圖鑑。
台灣腔細節:台灣腔 TTS 怎麼挑。
質量檢查清單(上片前 2 分鐘)
用這張清單,比「再聽一次感覺」更可靠:
| 檢查項 | 通過標準 |
|---|---|
| 第一句 | 3 秒內知道這片在講什麼 |
| 數字 | 全對,無亂唸 |
| 名詞 | 品牌、人名、地名正確 |
| 句長 | 沒有超級長句在喘 |
| 情緒 | 開場與 CTA 有差別 |
| 授權 | 商用/廣告需求已覆蓋 |
| 雜訊 | 無爆音、無奇怪停頓 |
| 音量 | 跟 BGM 平衡,人聲夠大 |
任何一項不過,就回去修稿或重生成,不要硬上。
真實工作流範例:一支 60 秒短片
假設你要做一支「3 個 TTS 翻車急救法」短片:
- 寫鉤子:「你的 AI 配音是不是一聽就假?」
- 寫 3 點:每點一句 + 一句做法
- 寫 CTA:「收藏這支,下次照修」
- 生成:先只生成鉤子,聽完再整段
- 修:數字與語助詞
- 配上字幕與畫面
- 檢查:授權、音量、前 3 秒
這流程大約 20~40 分鐘,比錄音快很多,但不能跳過第 4 步小測。
要自己錄還是用 AI?(很多人卡在這)
| 情況 | 建議 |
|---|---|
| 只是試想法 | AI 草稿 |
| 品牌形象很重要 | AI 起草 + 關鍵句真錄 |
| 情緒很重的段落 | 真人 |
| 量很大、常改稿 | AI 主力 |
| 要像本人 | 克隆或本人錄 |
| 要像專業配音員 | 內建好聲音或合作 |
實務上最常見: AI 做 90% 旁白,真人做 10% 關鍵句。
這樣又快,又不會失去人味。
成本與效率:到底省多少?
以前一支 60 秒旁白:
- 約時間:0.5~1 天
- 錄音:0.5~2 小時
- 改稿重錄:再 30 分鐘
用 AI 配音(熟練後):
- 寫稿:10~20 分鐘
- 生成與修:10~15 分鐘
- 剪輯對時:跟平常一樣
省的不是「配音這件事」,是「一直重來」。
所以前面的「小段測試」反而最重要——它讓你不用在最後一刻全部重來。
團隊怎麼建立 AI 配音 SOP?
如果你是團隊(頻道、課程、品牌):
- 固定稿子模板:開場/中段/CTA 各一個範本
- 固定聲音:不要今天換一個明天換一個
- 固定檢查清單:授權、數字、情緒
- 存成功案例:做成內部「好聲音樣本庫」
- 每季回顧:哪種句子最容易翻車,回頭改模板
這樣新人接手,也能維持相同聽感。
情緒與語氣:怎麼讓 AI「有感」?
死板的聲音,多半不是模型爛,是指令太白。
三層控制法
- 情緒標籤:開心/嚴肅/親切
- 導演模式:角色、場景、給誰聽
- 稿子本身:短句、感嘆、停頓
同一句話的三種感覺
| 寫法 | 聽起來 |
|---|---|
| 本產品性能優異。 | 像新聞 |
| 這支真的超順! | 像在推 |
| 說真的,我原本也不信。 | 像真人分享 |
你要哪一種,就寫哪一種。
免費方案怎麼用才聰明?
- 用真實稿,別用「你好世界」
- 小段生成,驗證再放大
- 記錄成功句型,下次複製
- 別一開始就買年費,先跑通流程
商用與平台:3 個必問問題
- 我的輸出可以放廣告嗎?
- 聲音是誰的權利?要署名嗎?
- 平台(YouTube/有聲書)有沒有額外規定?
授權地雷:商用 AI 配音授權。
YouTube:AI 配音與 YouTube 規則。
不同用途的最佳流程
短影音(15~60 秒)
- 先寫鉤子(前 3 秒)
- 生成短旁白
- 聽節奏是否卡
- 配畫面,不夠長再補句
延伸:短影音鉤子旁白。
YouTube 長片
- 分段稿(開場/重點/CTA)
- 分段生成
- 關鍵句真人補錄
- 檢查是否有抄襲或誤導
線上課程
- 示範用真人
- 解說用 AI
- 改稿只重生成解說段
延伸:AI 做課程。
有聲書
- 先測 1 章
- 看長文穩定與角色策略
- 再談整本量產
延伸:AI 有聲書上架。
決策表:如果 X → 選 Y
| 如果你… | 就… |
|---|---|
| 第一次嘗試 | 5 句小測,不要全片 |
| 要台灣在地感 | 台灣腔專頁 |
| 要像自己 | 聲音克隆(要有素材與同意) |
| 多角色劇情 | 多角色配音文 |
| 要放廣告 | 先確認商用授權 |
| 預算 0 | 免費額度試,正式片再升級 |
30 分鐘行動計畫
| 時間 | 動作 |
|---|---|
| 0–10 分 | 寫 5 句真實稿 |
| 10–18 分 | 挑聲音並生成 |
| 18–25 分 | 修數字/分句 |
| 25–30 分 | 上傳 15 秒測試片,看觀感 |
進階技巧:讓人覺得「這很專業」的小事
1. 開場 1 秒不要靜音
很多人輸出時前面有一段空白。剪掉,不然觀眾以為沒聲音。
2. 關鍵字稍微放慢
專有名詞、金額、日期,可以拆句或重複一次重點。
3. 用「問題→答案」結構
- 「為什麼你的 AI 配音很假?」
- 「多半是稿子太書面。」
這種結構也比較容易被搜尋與摘要。
4. 同一支片不要混太多聲音
除非是多角色劇情。旁白與角色聲一多,觀眾會混亂。
5. 字幕與聲音要對齊
AI 配音字幕容易差半拍。上片前滑一下,別讓嘴型與字幕打架(即使是動畫字幕也要對節奏)。
6. BGM 不要蓋過人聲
人聲清晰度 > 氣氛音樂。先調人聲到「不看字幕也聽得清」,再放音樂。
7. 留「真人感」痕跡
偶爾保留一個很短的停頓、一個自然重音,會比全程完美平順更像人。
常見問題 FAQ
AI 配音像真人嗎?
可以很像,但取決於素材、稿子與工具。口語稿 + 乾淨素材,通常比公文腔好聽十倍。
免費 AI 配音能放 YouTube 嗎?
要看法條與平台規定。很多「免費」只限個人測試。上片前看商用條款。
中文 AI 配音哪個最自然?
沒有唯一答案。先聽語助詞、台灣腔、數字唸法。可看 中文 TTS 比較。
為什麼我做的 AI 配音很機械?
多半是稿太書面、句子太長、一次生成太多。改短句、加語氣、分段生成。
AI 配音會被 YouTube 嗎?
YouTube 主要打擊低價值量產與誤導內容,不是單純禁止合成聲音。重點仍是原創與觀看價值。
要不要直接聲音克隆?
固定個人 IP 值得;只是試影片,先用內建聲音就好。
一句話收斂
AI 配音的重點: 稿子像人講話 → 小段驗證 → 再量產。
聲音只是載體,你的句子才是靈魂。
現在就可以做的事
延伸閱讀
最後更新:2026 年 9 月。各工具額度與授權可能變動,請以官方頁面為準。

