我把自己的聲音交給 AI:聲音克隆實測後的真心話

我把自己的聲音交給 AI:聲音克隆實測後的真心話

第一次聽到「另一個我」開口,說實話是有點毛的。

那是我把自己的聲音丟進聲音克隆工具後的第三分鐘。它用我的語氣、我的斷句習慣,唸了一段我從來沒寫過的稿子。九成像我,剩下的一成是哪裡說不上來的「平」,但已經足夠讓我當場決定:這個東西我要認真測。

接下來兩個禮拜,我用它做了三十條配音——短影片旁白、課程口播、產品介紹、有聲書式的長文,甚至拿去唸我寫壞的冷笑話。這篇就是我全部的實測結果:能用的地方、不能用的地方,還有錄樣本時那些沒人告訴你的坑。

聲音克隆的工作現場

為什麼我想克隆自己的聲音

原因很單純:產量。

我每個禮拜要固定產出四到五支短影片,旁白全靠自己錄。問題是人的聲音不是機器——前一晚熬夜、感冒、空氣太乾,隔天的錄音就是不能用的。最慘的一次,一支兩分鐘的影片我重錄了五次,只因為每次的音色都對不上上一支,觀眾聽起來就像換了個人。

直接換成現成的 AI 聲音當然也可以,但頻道的「人」的味道就斷了。觀眾訂閱的是你這個人,不是一個好聽的陌生人。所以聲音克隆對我來說不是炫技,而是把「我自己的聲音」變成一個可以備份的資產——聲音狀況再差,照樣出片,而且聽起來還是我。

樣本是怎麼錄的

流程比我想像中簡單:對著麥克風唸指定句子,大約九十秒,上傳,等十幾分鐘就有結果。

但「簡單」不代表「隨便錄就好」。我第一版樣本直接在家裡書桌錄,結果成品每次唸到捲舌音都有明顯的雜訊,後來才發現是冷氣出風口正對著麥克風吹。重錄第二次時我做了三件事:關掉冷氣、麥克風離嘴一個拳頭遠、挑下午相對安靜的時段,第二版的乾淨程度完全不同。

還有一個重點是樣本內容的多樣性。如果樣本裡只有平平的陳述句,克隆出來的聲音就永遠只會「平平地講話」。後來我刻意在樣本裡保留自然的語氣起伏——有疑問句、有驚嘆、有一點笑意——成品明顯活了起來,連我自己有時候都會忘記那不是真人錄的。

三十條配音之後,哪些情境能用

實測下來,最適合的是「資訊型」內容。

短影片旁白是我用最多的:三分鐘的稿子,生成加修大概五分鐘收工,聽起來就是我本人,朋友完全沒發現。課程口播也好用——那種一講二十分鐘、內容紮實但不太需要情緒起伏的段落,AI 版的我比真實的我更穩定,不會後面越講越累、音調越飄。

另外一個意外收穫是修改成本。以前客戶改一個字,我就要重錄一整句,還要對齊上一句的音色和音量;現在同一個句子生成三次、挑最好的版本就好。對有完美傾向的人來說,這省下來的時間和心力非常可觀。

哪些情境我還是會自己錄

第一個是廣告。客戶花的錢值得「人的溫度」,尤其是情緒層次豐富的那種——興奮、壓抑、留白之間的轉換,AI 目前給的多半是「單一情緒開到底」,聽久了會膩。

第二個是需要即時反應的內容,例如直播、訪談。克隆聲音的前提是有稿,有稿才有戲;沒有稿的場合它幫不上忙。

第三個比較意外:太短的句子。一兩秒的標語,AI 版常常少了那個「甩尾」的力道。長句它處理得很好,短句反而露餡。所以我的分工方式現在很固定:內容主體交給克隆聲音,開場、結尾、需要打中人心的那一句,自己進錄音室錄。整支影片聽起來還是我,但情緒最重的地方是真的我。

樣本錄得好壞,差多少

差非常多,這是我整個實測最大的心得。

同一個工具、同一份稿子,用隨手錄的樣本和用認真錄的樣本,成品的聽感大概是「手機喇叭」和「監聽耳機」的差距。樣本裡的環境噪音會被模型學進去,變成你的聲音的一部分;樣本裡的唸稿腔,也會變成成品永遠甩不掉的腔調。

幾個我重複驗證過的技巧:錄之前先聊幾句話熱身,聲帶醒著的時候錄出來的樣本比較立體;句子之間的停頓照平常講話的習慣,不要刻意憋氣換氣;還有,不要用耳機附的麥克風,至少用一支入門等級的領夾麥或電容麥。這些細節不用花大錢,但每一項都直接反映在成品上。

大家最常問的兩件事

「會被聽出來是 AI 嗎?」資訊型內容,目前多數人聽不出來。我拿給十個朋友盲測,只有兩個覺得「怪怪的,但說不上來哪裡怪」。但情緒戲不行,那一成的差距會被放大到很明顯。

「可以克隆別人的聲音嗎?」不行,這條線非常清楚。克隆任何人的聲音都需要本人同意,這不只是平台規則,在很多地方已經是法律問題,跟聲音授權的概念直接相關——我在什麼是 TTS 那篇文章裡有整理過。我自己的原則很簡單:只克隆自己的聲音,商業專案另外把授權文件簽好,保護自己也保護客戶。

兩個禮拜下來的時間帳

具體數字最有說服力。以前一支三分鐘旁白影片,光錄音階段就是:錄十五分鐘、剪掉口誤重來的片段十分鐘、去噪加音量標準化十五分鐘,還沒開始剪片就先燒掉四十分鐘。現在:貼稿生成五分鐘、挑版本兩分鐘、微調音量五分鐘,十二分鐘收工,品質的下限反而更穩。

要提醒的是,生成不是按一次就完美。我平均每條配音生成兩到三次,挑最自然的那版,所以估時間請把「挑選」算進去——這是流程的一部分,不是瑕疵。另外還有一筆沒算進去的隱形收益:半夜想到的好點子,以前要等隔天聲音醒著才能錄,現在直接生成,靈感不會過夜變質。

克隆聲音還解決了一個我以前沒意識到的問題:連續性。把兩支舊影片並排聽,我的音色會有微妙的差異——麥克風距離不同、身體狀態不同。克隆版每天都是「百分之百的我」。對頻道來說,這種穩定會被觀眾解讀成一種專業。

如果你跟我一樣是獨自作業的創作者,這種「把體力活外包給昨天的自己」的感覺,試過一次就回不去了。

給想試的人的三個建議

一,樣本值得認真錄。九十秒的投入,決定的是之後每一支影片的品質,這是整個流程裡 CP 值最高的一段準備時間。

二,先從不需要情緒的內容開始用。旁白、課程、資訊整理,等熟悉了工具的脾氣,再挑戰更複雜的稿子,挫折感會少很多。

三,把你的克隆聲音當成一個新進員工。先給它簡單的活,慢慢熟悉它的極限在哪裡,你自然會知道什麼時候該自己上、什麼時候可以放手。

想開始的話,Soundwaver 的聲音克隆功能可以直接試,樣本錄好上傳就行。

最後補一個組合技:如果你也是每週固定出片的創作者,這篇短影片旁白的八個技巧跟聲音克隆是絕配——一個管稿子的節奏,一個管聲音的供應,兩個都用上,你會發現出片壓力真的少一半。

分享這篇文章
XFacebookLINE