我做過一件很不符合成年人形象的事:連著三個禮拜,用 AI 聲音做了五十支迷因影片。
起因很單純。我幫客戶做正經產品影片,做到第三支的時候,腦袋需要透气,於是開了另一個資料夾專門放我自己的梗。沒想到其中兩支被轉發到比我本業帳號還多的地方,於是我認真了,一路做到五十支。
這篇把這五十支的實戰筆記攤開:搞笑影片的旁白到底哪裡跟正經影片不一樣、AI 聲音在笑點上的優勢跟死穴、還有我反覆驗證出來的稿子結構。想用 TTS 做搞笑內容的人,這篇可以直接抄。
笑點是節奏,不是文字
先講最重要的一件事:喜劇的笑點,一半以上是節奏。
同一句「他甚至沒有道歉」,用播報腔唸是新聞,用憋著笑的短促語氣唸就是梗。文字一模一樣,效果差十倍。這也是大部分人第一次用 AI 做搞笑影片失敗的原因——他們只改了稿,沒改節奏。
AI 沒有情緒,但它聽標點。我的做法是:把情緒寫進標點裡。
- 想要停頓製造反差 → 用句號斷開,別用逗號。
- 想要突然爆發 → 感嘆號,而且前面那句要短。
- 想要那種「你在認真講幹話」的死魚腔 → 全段都不加感嘆號,長句到底。
- 想要講到一半破功 → 破折號「——」超好用,等於語音版的「差點笑出來」。
範例。原文:「他說他會改,結果他改了頭像。」太平了。 改:「他說他會改。」(句號)「結果他改了頭像!」(感嘆號) 停頓出現,笑點才有地方落腳。
選聲音比選稿還重要
五十支影片裡我用了大概八種聲音,最後固定用的只有兩支:一支低沉平穩、一種「認真講荒謬事」的反差感;另一支偏亮偏快,適合節奏明快的剪輯。
我的選擇標準只有一條:聲音本身好不好笑不重要,跟畫面反差大不大才重要。
畫面越荒謬(一隻貓正襟危坐開會),聲音越要冷靜。畫面越普通(一個人在辦公室加班),聲音反而可以誇張一點。反差就是喜劇的引擎,這條規則在哪都適用。
順帶一提,別選那種聽起來「像在唸课文」的標準播報音。搞笑內容用它,就像穿西裝去泳池——不是不行,是很怪。
五秒鉤子,十五秒笑點,剩下都是收尾
我把結構壓成一個公式,五十支裡表現好的都長得差不多:
0–2 秒:鉤子。 一句話製造懸念或不和諧感。「我們開了一個很正式的會議——對象是一隻貓。」觀眾滑到這裡會停,因為資訊不完整。
2–5 秒:鋪墊。 補一點情境,讓荒謬合理化。「議程有三項:罐頭、開罐頭、以及關於罐頭的檢討。」
5–15 秒:笑點。 這裡是節奏最關鍵的地方,句子要短,標點要狠。「第一項,通過。(停)第二項,通過。(停)第三項——貓睡著了,散會。」
15 秒後:收尾。 一句話帶走,不戀戰。搞笑影片最怕笑點之後還硬撐十秒,那十秒會把前面的分數全部扣回來。
剪輯節奏要幫聲音一把
AI 語音有一個天生劣勢:它的呼吸是假的。聽久了細膩的人會覺得「有哪裡怪怪的」,但講不出來。我的解法是在剪輯上補:
- 笑點句前面留 0.2 秒靜音,等於幫聲音「吸口氣」。
- 重要句子的畫面切換卡在語音重音上,不卡拍點也要卡重音。
- 全片墊一層很輕的底噪或 lo-fi 背景樂,掩蓋合成感。音量要低到幾乎察覺不到,作用是讓耳朵有個「現場」的錯覺。
這三招加起來,觀眾留言從「AI 配音怪怪的」變成「這誰配的好好笑」。同一個工具,差別只在你有沒有幫它補戲。
踩過的雷
雷一:梗太長。 我前十支有一半在鋪陳,數據慘不忍睹。觀眾沒耐心等你鋪,前三秒沒鉤住就滑走了。現在我的規則是:鋪墊超過五秒就砍。
雷二:太依賴雙關。 雙關在文字裡好用,在音頻裡是災難——聽眾聽一次音,沒有第二次機會看懂。搞笑影片優先用「情境荒謬」而不是「文字遊戲」。
雷三:語氣全片一致。 從頭到尾一個調調,等於沒有調調。哪怕整片只在笑點處變一次語速,觀眾的耳朵都會抓到那個變化,笑點就立住了。
雷四:忘記加字幕。 一半觀眾是靜音滑動的。笑點句一定要有字幕,而且字幕要跟語音同步出現,不是整段一次冒出來。
可以直接抄的稿子結構
把這五句填空,一支影片的稿就完成了:
- 鉤子:「我們做了一件很沒必要的事——」
- 背景:「因為(一個荒謬的原因)。」
- 清單笑點:「第一(通過/失敗)。第二(通過/失敗)。第三——(意外)。」
- 一句死魚腔結論:「以上,會議結束。」
- 行動句:想訂閱就放這裡,語氣要像不太在乎。
我五十支裡觀眾最買單的三支,用的都是這個骨架,只有題材在換。
笑是會上癮的
做到第三十支的時候,我發現自己的文案習慣整個變了:句子變短、開頭變狠、刪掉所有形容詞。這些習慣回過頭來,把我本業的產品影片也變好了——因為產品影片缺的其實也是節奏。
所以就算你不打算做迷因帳號,我也建議你試著用 TTS 做三支搞笑影片。不是為了紅,是為了逼自己把「節奏」這兩個字練進肌肉裡。練完回去做正經內容,你會覺得以前的稿子像沒放鹽。


