導航軟體報路、語音助理回話、短影片裡的旁白——你每天聽到的聲音,有很大一部分已經不是人錄的。這些聲音背後的技術,就叫 TTS(Text-to-Speech,文字轉語音)。
這篇用白話拆解它的運作方式,不講數學,看完你會知道 AI 的聲音是怎麼「長」出來的。
先說結論:TTS 在做的事
把一段文字丟進去,出來一段像人講話的聲音。聽起來簡單,但你回想一下自己講話的過程:看到字、腦中組織發音、喉嚨出聲、語氣隨情緒變化。機器要把這整條鏈路模仿出來,每一步都有難題。
聲音是怎麼被合成的
現代 TTS 主要分三步:
第一步,文字分析。 機器先「讀」你的文字。這裡處理的事情比想像中多——分詞、多音字判斷(「銀行」跟「走路」的行)、數字唸法(2026 是「二零二六」還是「兩千零二十六」),還有標點帶來的停頓。
第二步,聲學模型。 把文字變成一串聲音特徵。音調高低、語速快慢、重音落在哪,都是在這一步決定的。
第三步,聲碼器(Vocoder)。 把特徵變成真正的音訊波形。這步直接決定聲音聽起來乾不乾淨。

為什麼以前的機器人聲音那麼假
你可能還記得早期導航或客服語音那種一字一頓的腔調。那是因為老式 TTS 是「拼貼」出來的:錄一個人講幾千個音節,再照文字把音節接起來。接縫處的音調對不上,就會有明顯的機器感。
神經網路 TTS 完全換了一個做法:模型直接學「這段文字對應這段波形」的關係,聽起來是連續生成,不是拼貼。所以現在的聲音才有自然的連音、語氣起伏,甚至能笑、能嘆氣。
它現在能做到什麼
一句話的稿子,幾秒內變成自然語音;只要幾十秒的樣本,就能複製某個人的音色;同一段文字還能套上不同角色——有活力的廣告腔、溫和的說書腔,都行。
還做不到什麼
說真的,長文播客級的穩定度還是難關:三千字唸下來,中間總有幾句節奏跑掉。情緒的細膩度也是——你叫 AI「悲傷地唸」,它給的通常是「稍慢加稍低」的公式化處理,跟真人演員的層次還有距離。
所以實用的做法是:把 TTS 當成「會講話的錄音室」,而不是「替身演員」。稿子的節奏你自己掌控,機器負責把聲音乾淨俐落地唸出來。
想試試看
到 Soundwaver 的免費 Demo 輸入一段話,幾秒就有結果。建議第一次就選你最熟的領域寫稿——你越熟,越容易聽出哪裡「不像人講的」,這也是你判斷工具好壞最快的方法。
