讓 AI 聲音有情緒:我花一週試出來的語氣控制筆記

讓 AI 聲音有情緒:我花一週試出來的語氣控制筆記

很多人用 AI 配音的第一個抱怨,不是「不好聽」,是「沒感情」。明明聲音很自然,唸出來卻像在讀報,字字正確,句句平淡。

我本來也這麼想。直到某支客戶的廣告片,老闆只丟了一句話:「這支要熱血一點,你想想辦法。」我照著網路上教的,在指令欄打「用興奮的語氣、充滿能量地唸」,出來的結果……比較像一個人被迫嗨,尷尴尬尬。

那之後我花了一整個禮拜,把自己當白老鼠,反覆試各種讓 AI 聲音「有情緒」的招。這篇把我真正有用的方法記下來,包括那些被神話、其實沒用的東西,你就不用再踩一次坑。

先說結論:情緒不是一個按鈕

多數工具都有一個「情緒」或「風格」的選項,但實際測起來,那只是把語速和音高做固定組合——開心就是快一點高一點、悲傷就是慢一點低一點。它不會真的「理解」你這句話在難過還是在嘲諷。

所以與其期待按鈕,不如把情緒「寫進稿子裡」。這是整篇最核心的一句話:AI 的情緒來自你給的文字,不是來自你的指令。

我犯的第一個錯:直接下情緒指令

我的第一版做法,是在系統提示寫「請用溫柔的語氣」。結果呢?它把整段都變慢、變輕,聽起來不像溫柔,像沒睡飽。

後來我才搞懂,這類指令對模型的影響很「平均」——它會把整段聲音一起往下壓,而不是在該溫柔的地方溫柔。你要的情緒起伏,指令給不了,文字才給得了。

第一招:標點是情緒的節拍器

這是我收穫最大的一招,簡單到有點蠢,但真的有用。

句號是停頓,驚嘆號是用力,刪節號是猶豫。 你稿子裡怎麼打標點,AI 就怎麼喘氣。同一個句子,換標點語氣完全不同:「這件事,我知道了。」是冷靜;「這件事……我知道了。」是遲疑;「這件事我知道了!」是篤定。

我後來養成一個習慣:寫稿時把標點當「呼吸記號」在打。要它急,就連續用短句加驚嘆號;要它緩,就把逗號拉多一點。真人配音員會做的事,其實就是用標點控制節奏,AI 也吃這套。

破折號跟頓號也很重要。 破折號能製造一個明顯的換氣和轉折,頓號則會讓列舉變快。你可以拿同一段話,只改標點,聽兩次,差別會嚇到你。

第二招:把情緒寫進句子,不要寫在指令

與其下指令「悲傷」,不如把悲傷寫出來。

舉個實際例子。要 AI 唸「我們的產品很便宜」,平淡得像公告。改成「我們的產品,比你想的還要便宜很多」——多了一個「比你想的」,語氣裡就多了一層對比和邀請感,不用任何指令。

關鍵是把「感受詞」放進文案。 「老實說」「講真的」「你可能不敢相信」「問題來了」「結果你猜怎麼著」——這些口語的轉折詞,就是情緒的錨點。AI 唸到這些詞,語氣自然會跟著走,因為它學的就是真人講這些詞的方式。

我現在寫稿的順序反過來了:先想「聽的人此刻應該有什麼感覺」,再把那個感覺翻譯成文字。文字到位了,情緒就到七成,剩下三成才靠語速補。

第三招:語速跟停頓,才是語氣的本體

情緒指令沒用,但「語速」跟「停頓」這兩個參數,是真的有用,而且立竿見影。

語速是情緒的最短路徑。 興奮、急迫,語速往上調一成到一成五;沉穩、感性、說教,往下調一成。差一點點,聽感差很多。我的體感是,同樣的稿子,1.0 倍聽起來是唸稿,1.15 倍像在講重點,0.9 倍像在跟你掏心掏肺。

停頓比你想的更有戲。 在關鍵句之前,塞一個明顯的停頓——用換行或破折號製造——聽的人會被「逼著」專心等下一句。這是所有說書人都在用的技巧,AI 也做得出來。

進階:那些被神話的功能

講幾個我親測後的心得,幫你省時間。

情緒標籤(emotion tag):有些工具支援在稿子裡標 [happy]、[sad] 這類標籤。我測下來,效果參差不齊——對「快樂」「悲傷」這種大方向有用,但「諷刺」「傲嬌」「欲言又止」這種細緻情緒,標了跟沒標一樣。它適合當輔助,不適合當主力。

SSML 語音標記:能精準控制停頓、音高、語速,功能很強,但門檻高,要寫程式碼般的標記。如果你只是要「語氣自然」,用不到;如果你要「每一句都精準」,它才值得學。

我試情緒控制時的工作畫面

我留下來的三個情緒模板

試了一週,我把最常用的三種情境,固定成三個「模板」,之後直接套:

熱血開場:短句連發+驚嘆號+語速 1.15。「注意!機會只有一次。錯過,就沒有下一次了。」

感性說故事:刪節號+語速 0.9+長一點的停頓。「那一年……我們什麼都沒有,只有一個,很笨的念頭。」

專業解說:句號為主+語速 1.0+少用驚嘆號。「這個技術的原理,其實很簡單。我們一步一步來看。」

模板不是萬能,但能讓你在十分鐘內,從零到有一支「有語氣」的配音。

哪些情緒,AI 現在還做不到

我不想把話說滿。實測下來,這幾種情緒,AI 目前給不了你要的層次:

真正的爆發。 大吼、崩潰、喜極而泣,這種需要「破音」的情緒,AI 一用力就失真,聽起來像訊號壞掉。

哭腔跟哽咽。 它會變慢變輕,但不會真的「哽咽」,那個生理上的細節,模型學不來。

曖昧的反諷。 嘴上說好、心裡罵人的那種語氣,人類一秒就懂,AI 只會照字面唸,完全抓不到。

遇到這三種,我會老實承認:這稿子得找真人。省下來的時間跟錢,剛好補在真的需要人的地方。

我現在改稿的三個動作

把方法收斂成三個每次都做的動作,幾分鐘就完成。

第一,讀一遍,標出「情緒轉折點」。 哪裡要它慢、哪裡要它停、哪裡要它用力,先在稿子上畫出來,才不會唸成一條直線。

第二,把平淡句改成「有錨點的句子」。 看到「我們的產品很好」,就改成「我們的產品,好到你可能不敢相信」。多幾個感受詞,語氣就有了。

第三,用標點做記號。 要停頓就換行、要遲疑就打刪節號、要強調就打破折號。標點不是裝飾,是給 AI 的呼吸指令。

這三個動作做熟之後,我發現自己連寫稿都會不自覺帶上語氣——因為你開始「用耳朵寫稿」,而不是用眼睛。

一週之後的帳

這禮拜我大概產了二十幾支配音,成功率(一次到位、不用大修)從原本的三成拉到七成。省的不是錢,是「來回試」的時間——以前一支要調十次,現在三次內搞定。

方法說穿了不難:標點當呼吸、情緒寫進字、語速停頓當表情。難的是你願不願意花半小時,把稿子重寫一次。多數時候,聲音沒感情,問題不在聲音,在稿子。

想從最基礎開始,先看 TTS 是什麼;如果做的是短影片,這篇 短影片旁白八技巧 能接著用。

分享這篇文章
XFacebookLINE