旁白配 BGM 完整指南:音量、ducking 與節奏的實戰數字

旁白配 BGM 完整指南:音量、ducking 與節奏的實戰數字

我做過一支三分鐘的產品介紹片,交件當天收到客戶回信,只有一句話:「音樂很好聽,但我在辦公室放,同事都回頭看我。」

隔天量工程檔我才發現,音樂只比旁白低 4dB——那不是墊樂,是二重唱。剪到第三個小時,耳朵早把這個音量當成正常值,調小還覺得「怎麼突然變這麼小」,但那通常還要再往下 8dB。

混音不服從感覺,只服從數字。這篇攤開我兩年來實際在用的值:音量對照、ducking 參數、節拍與語速、免版稅音樂的授權地雷,還有每週都看到的經典錯誤。

先把音量對照表背起來

dB 是相對值,我一律用「比旁白低多少」來記。實作上先把旁白峰值抓在 -6 到 -3 dB,BGM 大約落在 -21dB,起手就不會差太遠。

場景 BGM 比旁白低 我踩過的錯誤值
一般旁白墊樂 15~20 dB 只低 4~5 dB
數據句、重點句 20~25 dB 完全不動
無聲過場、字卡 3~6 dB 低 15 dB,音樂像斷線
開場 intro(還沒講話) 6~10 dB 直接滿版
結尾 outro 8~12 dB 再淡出 硬切

低 15dB 留氣氛,低 20dB 留輪廓。資訊密度高的教學片我壓到 20dB,生活 Vlog 放回 15dB——你回想最近看的影片,大概就這兩種。

Ducking:讓音樂自己讓路

Ducking 就是「人聲一出來,音樂自動變小」。我兩種都用。

手動關鍵幀(Premiere、DaVinci、剪映都有):旁白前 0.3 秒把音樂拉下 6~10dB,結束後 0.8~1 秒拉回。瑣碎但可控,重點句我一定手動,讓音樂在那句退得乾淨。

側鏈壓縮(自動 ducking):音樂軌掛壓縮器,用旁白軌觸發,參數照這組設:

  • Threshold:調到旁白一出聲就觸發
  • Ratio:3:1 到 4:1
  • Range/Reduction:-6 到 -10 dB,音樂被壓掉的深度
  • Attack 0.2~0.3 秒,Release 0.8~1.5 秒

Attack 太快音樂被捏一下,太慢吃掉前半句;Release 太短蹦回來突兀,太長整段都悶。我第一年用 0.05 秒 attack,總覺得音樂在喘,問題就在這。

剪輯軟體音軌上的 ducking 關鍵幀,旁白出現處音樂波形明顯下凹

節拍、語速,還有開場那三秒

音樂不是只要小聲,還要跟講話的節奏合得上。

BPM 是最直接的抓手:一拍 0.5 秒就是 120 BPM。中文旁白舒服的語速約每分鐘 240~280 字,重音大概每 0.5~0.7 秒一次,90~110 BPM 最合拍;128 BPM 舞曲墊在長句子下,會有「音樂在趕、人在拖」的拉扯感。

我固定做三件事:

  1. 說話前先墊 3 秒 music intro。 讓耳朵先熟悉調性,旁白第一個字進來才不突兀。零秒開口的影片,開頭總有那一秒的「硬」。
  2. 段落切換卡段落切換。 進到新章節時,讓音樂也換段。觀眾說不出為什麼舒服,但就是舒服。
  3. 無聲段把音樂拉回來。 過場、字卡沒有旁白時,BGM 從低 18dB 拉到低 3~6dB,節奏才接得上。純靜音超過 1.5 秒,滑動中的觀眾會直接滑走。

免版稅音樂:去哪裡拿,授權注意什麼

先糾正一個觀念:免版稅(royalty-free)不等於免費,付一次或免費,之後不再按次收授權金,與品質無關。我常用的來源:

  • Artlist、Epidemic Sound:訂閱制,全庫可用,適合每週出片的人。訂閱前先看清取消條款,舊下載能不能用在新片各家不同。
  • YouTube 音樂庫:免費、標示清楚,但授權只保證 YouTube 平台,搬去客戶官網或投廣告就未必。
  • Pixabay Music、Free Music Archive:免費商用,品質參差,用前確認頁面有 CC0 或明確商用條款。
  • 單曲購買(AudioJungle 這類):適合要長期投放、需要白紙黑字授權書的案子。

三個地雷:Spotify、Apple Music 的歌剪片不行;要求署名就照做;Content ID 申訴要憑證、很花時間。乾淨的做法只有一個:只用來源清楚的音樂庫。

經典錯誤,我幾乎每週都看到

  1. 音樂太滿。 選了有人聲有鼓組的流行歌,再怎麼壓都在搶。墊樂要選「有氛圍沒主角」的:pad、輕電子、無人聲 lo-fi。
  2. 人聲頻段被蓋。 人聲清楚度靠 200Hz~4kHz,音樂能量也堆在這。音樂軌掛 EQ:80Hz 以下高通,200Hz 挖 2~3dB,2~4kHz 挖 3dB,音樂立刻退到後面。
  3. Loop 接縫明顯。 八秒的音樂重複三十次,第二十次那下「咔」聽得很清楚。找 8 或 16 小節做 loop,接縫對齊小節線。
  4. 全片一個音量。 開場跟重點句一樣大聲,等於沒有重點。音量本身就是排版。
  5. 選有歌詞的歌。 聽眾要同時處理兩套語言,哪邊都記不住。
  6. 結尾硬切。 至少留 0.5 秒淡出,或讓 outro 走完。

TTS 旁白跟真人不一樣,混法要跟著改

這段是我用 AI 旁白才摸出來的。真人錄音有底噪、呼吸聲、殘響,反而給音樂融化的空間,墊個低 14dB 聽起來還是合的。TTS 底噪乾淨、沒有呼吸、音量一致得像被壓過,等於一條裸露的人聲。兩個差異:

  • 音樂要壓得更狠。 同一支片換 TTS 旁白,我把墊樂從低 15dB 改到低 18~20dB。乾淨人聲沒有東西掩蓋,音樂高一點點就貼上來,聽起來像在蓋人聲,其實音量沒變。
  • 氣口要自己補。 真人會換氣,TTS 不會。句與句之間我留 0.3~0.5 秒讓律動補進來,重點句前留 0.5~0.8 秒,等於用音樂幫聲音吸一口氣。

TTS 也有好處:整段音量一致,你畫的關鍵幀每句都對得上,不用像真人那樣一句句補。

拿到旁白軌我固定跑六步:峰值收到 -6 到 -3 dB;音樂進軌先設 -15dB;音樂軌掛 EQ 切低頻挖中頻;照上面那張表畫 ducking;開場墊 3 秒 intro、結尾留 1 秒 outro;最後耳機、喇叭、手機各聽一次——低頻沒了音樂還很清楚,就是太響。前五步五分鐘,第六步救過我三次交件。

數字對了,耳朵就會告訴你對了

回到開頭那支片子。我把音樂從低 4dB 重調到低 17dB,同一首歌、同一段旁白,客戶第二次的回信是「這次可以放了」。歌沒變,我只是終於讓它退回配角的位置。

墊樂低 15~20dB、ducking 壓 6~10dB、intro 墊 3 秒、無聲段拉回低 3~6dB——先套這四個數字,求不出錯,再調出自己的習慣。我自己的流程是在 Soundwaver 生成旁白、再進剪輯軟體配樂,方案看 /pricing/,想先拿乾淨音檔練這套數字,到 /tts/ 打幾句話幾秒就有。

分享這篇文章
XFacebookLINE