我做過一支三分鐘的產品介紹片,交件當天收到客戶回信,只有一句話:「音樂很好聽,但我在辦公室放,同事都回頭看我。」
隔天量工程檔我才發現,音樂只比旁白低 4dB——那不是墊樂,是二重唱。剪到第三個小時,耳朵早把這個音量當成正常值,調小還覺得「怎麼突然變這麼小」,但那通常還要再往下 8dB。
混音不服從感覺,只服從數字。這篇攤開我兩年來實際在用的值:音量對照、ducking 參數、節拍與語速、免版稅音樂的授權地雷,還有每週都看到的經典錯誤。
先把音量對照表背起來
dB 是相對值,我一律用「比旁白低多少」來記。實作上先把旁白峰值抓在 -6 到 -3 dB,BGM 大約落在 -21dB,起手就不會差太遠。
| 場景 | BGM 比旁白低 | 我踩過的錯誤值 |
|---|---|---|
| 一般旁白墊樂 | 15~20 dB | 只低 4~5 dB |
| 數據句、重點句 | 20~25 dB | 完全不動 |
| 無聲過場、字卡 | 3~6 dB | 低 15 dB,音樂像斷線 |
| 開場 intro(還沒講話) | 6~10 dB | 直接滿版 |
| 結尾 outro | 8~12 dB 再淡出 | 硬切 |
低 15dB 留氣氛,低 20dB 留輪廓。資訊密度高的教學片我壓到 20dB,生活 Vlog 放回 15dB——你回想最近看的影片,大概就這兩種。
Ducking:讓音樂自己讓路
Ducking 就是「人聲一出來,音樂自動變小」。我兩種都用。
手動關鍵幀(Premiere、DaVinci、剪映都有):旁白前 0.3 秒把音樂拉下 6~10dB,結束後 0.8~1 秒拉回。瑣碎但可控,重點句我一定手動,讓音樂在那句退得乾淨。
側鏈壓縮(自動 ducking):音樂軌掛壓縮器,用旁白軌觸發,參數照這組設:
- Threshold:調到旁白一出聲就觸發
- Ratio:3:1 到 4:1
- Range/Reduction:-6 到 -10 dB,音樂被壓掉的深度
- Attack 0.2~0.3 秒,Release 0.8~1.5 秒
Attack 太快音樂被捏一下,太慢吃掉前半句;Release 太短蹦回來突兀,太長整段都悶。我第一年用 0.05 秒 attack,總覺得音樂在喘,問題就在這。

節拍、語速,還有開場那三秒
音樂不是只要小聲,還要跟講話的節奏合得上。
BPM 是最直接的抓手:一拍 0.5 秒就是 120 BPM。中文旁白舒服的語速約每分鐘 240~280 字,重音大概每 0.5~0.7 秒一次,90~110 BPM 最合拍;128 BPM 舞曲墊在長句子下,會有「音樂在趕、人在拖」的拉扯感。
我固定做三件事:
- 說話前先墊 3 秒 music intro。 讓耳朵先熟悉調性,旁白第一個字進來才不突兀。零秒開口的影片,開頭總有那一秒的「硬」。
- 段落切換卡段落切換。 進到新章節時,讓音樂也換段。觀眾說不出為什麼舒服,但就是舒服。
- 無聲段把音樂拉回來。 過場、字卡沒有旁白時,BGM 從低 18dB 拉到低 3~6dB,節奏才接得上。純靜音超過 1.5 秒,滑動中的觀眾會直接滑走。
免版稅音樂:去哪裡拿,授權注意什麼
先糾正一個觀念:免版稅(royalty-free)不等於免費,付一次或免費,之後不再按次收授權金,與品質無關。我常用的來源:
- Artlist、Epidemic Sound:訂閱制,全庫可用,適合每週出片的人。訂閱前先看清取消條款,舊下載能不能用在新片各家不同。
- YouTube 音樂庫:免費、標示清楚,但授權只保證 YouTube 平台,搬去客戶官網或投廣告就未必。
- Pixabay Music、Free Music Archive:免費商用,品質參差,用前確認頁面有 CC0 或明確商用條款。
- 單曲購買(AudioJungle 這類):適合要長期投放、需要白紙黑字授權書的案子。
三個地雷:Spotify、Apple Music 的歌剪片不行;要求署名就照做;Content ID 申訴要憑證、很花時間。乾淨的做法只有一個:只用來源清楚的音樂庫。
經典錯誤,我幾乎每週都看到
- 音樂太滿。 選了有人聲有鼓組的流行歌,再怎麼壓都在搶。墊樂要選「有氛圍沒主角」的:pad、輕電子、無人聲 lo-fi。
- 人聲頻段被蓋。 人聲清楚度靠 200Hz~4kHz,音樂能量也堆在這。音樂軌掛 EQ:80Hz 以下高通,200Hz 挖 2~3dB,2~4kHz 挖 3dB,音樂立刻退到後面。
- Loop 接縫明顯。 八秒的音樂重複三十次,第二十次那下「咔」聽得很清楚。找 8 或 16 小節做 loop,接縫對齊小節線。
- 全片一個音量。 開場跟重點句一樣大聲,等於沒有重點。音量本身就是排版。
- 選有歌詞的歌。 聽眾要同時處理兩套語言,哪邊都記不住。
- 結尾硬切。 至少留 0.5 秒淡出,或讓 outro 走完。
TTS 旁白跟真人不一樣,混法要跟著改
這段是我用 AI 旁白才摸出來的。真人錄音有底噪、呼吸聲、殘響,反而給音樂融化的空間,墊個低 14dB 聽起來還是合的。TTS 底噪乾淨、沒有呼吸、音量一致得像被壓過,等於一條裸露的人聲。兩個差異:
- 音樂要壓得更狠。 同一支片換 TTS 旁白,我把墊樂從低 15dB 改到低 18~20dB。乾淨人聲沒有東西掩蓋,音樂高一點點就貼上來,聽起來像在蓋人聲,其實音量沒變。
- 氣口要自己補。 真人會換氣,TTS 不會。句與句之間我留 0.3~0.5 秒讓律動補進來,重點句前留 0.5~0.8 秒,等於用音樂幫聲音吸一口氣。
TTS 也有好處:整段音量一致,你畫的關鍵幀每句都對得上,不用像真人那樣一句句補。
拿到旁白軌我固定跑六步:峰值收到 -6 到 -3 dB;音樂進軌先設 -15dB;音樂軌掛 EQ 切低頻挖中頻;照上面那張表畫 ducking;開場墊 3 秒 intro、結尾留 1 秒 outro;最後耳機、喇叭、手機各聽一次——低頻沒了音樂還很清楚,就是太響。前五步五分鐘,第六步救過我三次交件。
數字對了,耳朵就會告訴你對了
回到開頭那支片子。我把音樂從低 4dB 重調到低 17dB,同一首歌、同一段旁白,客戶第二次的回信是「這次可以放了」。歌沒變,我只是終於讓它退回配角的位置。
墊樂低 15~20dB、ducking 壓 6~10dB、intro 墊 3 秒、無聲段拉回低 3~6dB——先套這四個數字,求不出錯,再調出自己的習慣。我自己的流程是在 Soundwaver 生成旁白、再進剪輯軟體配樂,方案看 /pricing/,想先拿乾淨音檔練這套數字,到 /tts/ 打幾句話幾秒就有。


