很多人第一次用文字轉語音(TTS),會卡在同一件事:工具打開了,卻不知道從哪一步開始。
這篇不講理論,直接走一條「三分鐘能出成品」的路。你需要的只有三樣:一段稿、一個聲音、一個輸出檔。

先說結論:三步就夠
- 寫好口語稿(不是作文)
- 挑聲音、加節奏(標點比指令有用)
- 生成、聽、改一句、再輸出
下面把每一步拆開,附上我實測後真正有用的細節。
第一步:把稿子改成「會講話的文字」
TTS 唸不好,八成不是引擎的問題,是稿子太像書面語。
今天就能改的 3 件事:
- 長句拆短。超過 40 字、中間沒逗點的句子,機器很容易喘不過氣。
- 數字寫清楚。「3.5 萬」會被唸成「三點五萬」或「三五萬」,你在意哪種,就先寫成那種。
- 品牌名、英文縮寫先決定唸法。APP 要唸「A-P-P」還是「欸噗噗」,稿子裡先定案。
小技巧: 自己小聲自己小聲唸一遍。唸起來卡住的地方,機器也會卡。

第二步:挑聲音,用標點控制節奏
聲音先挑「聽起來像你的觀眾會喜歡的人」,不要先挑最貴的。
真正讓配音「有戲」的,多半是:
- 逗點 = 換氣
- 句號 = 停半拍
- 驚嘆號 = 能量往上
- 括號情緒(例如(溫柔))= 整句濾鏡
- 方括號音效(例如[停頓])= 節奏點
叫 AI「開心一點」通常沒用;把「老實說」「你猜怎麼著」寫進稿子,語氣會自己出來。
第三步:生成 → 聽 → 只改一句
不要一次改整篇。正確順序是:
- 先生成一版「能聽」的
- 記下最不順的 那一句
- 只改那一句的標點或用詞
- 再生成,挑更好的一版
需要交件或剪片時,輸出 WAV 或 MP3 就能進剪輯軟體。做課程、有聲書、短影片旁白,同一套流程都能用。
什麼時候 TTS 很好用?什麼時候該找真人?
| 情境 | 建議 |
|---|---|
| 教學、資訊、旁白、量大改稿多 | TTS 很划算 |
| 品牌形象片、要大哭大笑的戲 | 找真人 |
| 你在做台灣市場的內容 | 先試台灣腔聲音 |
今天就可以做的第一支
挑一段 30 秒的稿——開場白或商品介紹都好——用上面三步走完。你會立刻知道:卡住的是稿子、聲音,還是節奏。
想再往下走,可以接著看:
準備好直接試,可以到 Soundwaver 文字轉語音 免費生成第一段。

