情緒標籤告訴 AI「這句話什麼感覺」,導演模式告訴它「你是誰、在哪裡、該怎麼說」。這一篇把三行指令拆到每一個字,全部可照抄。
聽聽導演模式的效果(白樺 · 深夜電台)
風格說明欄(指令寫這裡)
角色:深夜電台主持人 場景:凌晨的直播間 指導:壓低聲音,慢慢說
台詞框(要念的內容)
……城市睡了,我還在。
導演指令寫進工作室的「風格說明」欄——一個字都不會被唸出;台詞框裡的每個字都會被念出。
第一行 · 角色(誰在說)
身份決定音色質感與用詞習慣,越具體越好:「深夜電台主持人」比「主持人」準,「跑深夜班的朋友」比「朋友」更有畫面。
角色:深夜電台主持人
第二行 · 場景(在哪說)
空間與時間給 AI 演出的環境感。凌晨的直播間與熱鬧的賣場,同一句話會演出完全不同的樣子。
場景:凌晨的直播間
第三行 · 指導(怎麼說)
具體的演出指導:語速、共鳴、氣聲、停頓。這是最能「調音」的一行——寫法見下方四維指導。
指導:壓低聲音,慢慢說
照抄模板
角色:(誰在說) 場景:(在哪說) 指導:(怎麼說)
「指導」行寫得越具體,演出越可控。四個維度可以單用、也可以組合——同一句台詞,每次只改一維,點開對比:
共用前兩行指令
角色:溫柔的說書人 場景:冬夜的車裡
四個示範共用台詞
今晚的風很涼,我們把車停在路邊,誰都沒有說話。
1共鳴
聲音的支撐點——胸腔共鳴低沉紮實,頭腔共鳴明亮通透。
指導:加強胸腔共鳴,讓聲音低沉紮實
2語速頓挫
語速與停頓的節奏——慢半拍與留白,往往比快更抓耳。
指導:語速放慢,逗號處停頓半拍,句尾留白
3氣實聲轉換
氣聲與實聲的比例與轉換——氣聲私密、實聲篤定,漸變最自然。
指導:句首帶氣聲起音,中段轉實聲,句尾漸弱收氣
4咬字
字頭字尾的清晰度——咬字清楚顯專業,含糊帶懶音顯親近。
指導:咬字清晰,每個字頭字尾交代清楚,不要含糊
老手秘訣:點開試聽,感受同一句話只改一維的差別
每個範例都是「三行指令+台詞」的完整劇本,複製進工作室就能用。
深夜電台開場
低溫感敘事——語速放慢、共鳴下沉。
角色:深夜電台主持人 場景:凌晨的直播間 指導:壓低聲音,慢慢說
……城市睡了,我還在。
廣告口播
能量感與促單節奏——咬字清晰、句句推進。
角色:活力十足的廣告配音員 場景:黃金時段電視廣告 指導:咬字清晰,語速稍快,句尾上揚帶笑意
還在為配音煩惱嗎?幾秒鐘,把文字變成專業配音!
有聲書旁白
長時間耐聽——氣聲打底、語速平穩。
角色:有聲書旁白 場景:安靜的錄音棚 指導:語速平穩,句首帶氣聲,句尾漸弱收氣
那天晚上,小鎮下了第一場雪。
短視頻旁白
鉤子要快——前兩秒必須抓住人。
角色:短視頻旁白博主 場景:深夜的臥室錄音 指導:開頭提高能量抓住注意力,揭曉時壓低放慢
你敢信?這碗牛肉麵,藏在這條小巷裡三十年。
情緒不到位——聽起來還是「平」
在「指導」行加一維具體動作(如「帶氣聲,語速放慢」)。「有感情一點」這種籠統指令無效,具體動作才有效。
太用力——AI 演過頭
刪掉形容詞堆疊,只留一個方向。指令互相打架(又激動又溫柔)時,AI 只能亂演。
標籤或指令被唸出來了
檢查標點全半形與位置:(風格) 在句首、[音訊] 接句尾;三行指令只能放「風格說明」欄,進了台詞框就會被念出。
一次生成不像——別急著改指令
先多生成幾版(同輸入≠同輸出),挑最接近的版本,再微調指令。十版裡總有一版是對的。
導演模式是概率藝術——同一條提示詞,每次演出都不同。成熟的做法是:
同提示詞連續生成 3 版
試聽對比,挑出最接近想像的一版
微調指令(加或刪一維指導)再生成
聽聽這三版的差異——文本與指令完全相同,三次獨立合成:
同一提示詞 · 三版對比
不會。三行指令寫在「風格說明」欄,只作為演出指導送進模型;只有台詞框裡的內容會被念出。
沒有硬性上限,但 1-3 行具體指令效果最好。堆太長的指令會互相打架,反而稀釋重點。
可以。導演模式與聲音來源無關——克隆聲、設計聲、內建聲都吃三行指令,與 (風格) 標籤完全相容。
情緒標籤管單句的「情緒濾鏡」,導演模式管整段的「人物與空間」。常見組合:風格說明欄寫三行指令,台詞句首再疊 (興奮) 等標籤做句級微調。
能。導演模式內建於工作室,免費方案每月約 30 分鐘語音,不用信用卡。