從第一段語音到導演級演出——8 個關卡的完整闖關手冊,每一步都有可照抄的腳本與避坑清單,把「能出聲」練成「會演戲」。
中英雙語
模型與介面
8+
預置音色
30 秒
完成聲音克隆
秒級
文字變語音
免費方案每月約 30 分鐘語音,不用信用卡。
關卡 1 · 快速上手
3 步生成你的第一段語音
學完你能:一分鐘內生成第一段語音。
第一次來到 Soundwaver?照著動畫與三步走,一分鐘內就能聽到 AI 幫你開口說話。
台詞
STEP 1 · 台詞框輸入你想說的話
動畫自動循環播放,可隨時暫停
點擊右上角「工作室」,你會看到三大功能分頁。新手先留在「文字轉語音」就好,其他關卡稍後再解鎖。
不用安裝任何軟體,打開瀏覽器就能開工。
在輸入框打下任何句子,再從聲音列表選一個喜歡的嗓音。中文推薦晴晴(活潑)、柔柔(溫柔),英文試試 Aria。
滑桿可調語速(10-200%)與音高,先用預設值,聽熟了再微調。
按下生成按鈕,幾秒內就能試聽。滿意的話直接下載 WAV 或 MP3,馬上能用在你的影片、簡報或 Podcast 裡。
生成紀錄會自動存進歷史頁,手滑關掉也不怕。
生成前先檢查標點——「……」製造遲疑、「!」拉高音量、「?」帶出上揚語調。只改標點不改字,情緒立刻不同。
老手秘訣:重要台詞多生成幾版再挑——同一輸入每次演出都不同(詳見 Lv.7 工程與品質)。
關卡 2 · 文字轉語音
讓 AI 演出情緒,不是唸稿
學完你能:用標籤與標點,讓同一句話演出完全不同的情緒。
文字轉語音不只是「唸稿機」。看懂操作面板、學會標籤咒語與標點演技,它能替你演出整齣戲。
內建聲音各有語言與個性——中文有晴晴、柔柔、磊磊、沉風;英文有 Aria、Luna、Rex、Cole。
10% 到 200% 自由調整。旁白建議 90-110%,快節奏廣告可以拉到 130%。
想要低沉磁性就往下調,可愛童聲往上調,搭配語速一起微調效果最自然。
切換後 AI 會帶著旋律感演出,適合 jingle、生日祝福或趣味短片內容。
在文字裡插入標籤,就能直接指揮 AI 的情緒與呼吸。只要記住兩種寫法:
用小括號包住、寫在句子最前面,可以疊加多個,決定整句的演技基調。
(興奮)我們贏了!這場比賽實在太精彩了!
用方括號包住、附在句尾,控制停頓、氣口與擬真音效。
這個消息真是令人難以置信[嘆氣]讓我緩一緩。
台詞
先打好台詞
動畫自動循環播放,可隨時暫停
點標籤加進台詞,按「生成」立刻聽結果——這就是工作室的核心體驗。
點一個標籤加進台詞裡,感受 AI 演技的變化!
歡迎來到 Soundwaver,這裡是聲音的遊樂場。 ← 點擊標籤試試
( ) 風格/語言標籤
[ ] [音訊標籤]
點擊標籤會立刻合成並播放,先聽為快!
只改標點、不改字,AI 會演出完全不同的語氣——省略號遲疑低回,驚嘆號瞬間爆發。聽聽這組對比:
喜歡這個效果?去工作室用同款音色配音 →
老手秘訣:合成小秘诀:送進 WaveMind 的文字與標籤本身用簡體中文寫(如 (开心)、[叹气])——WaveMind 對繁體字的發音與標籤辨識較不穩定。頁面顯示照常用繁體即可。
進階玩法:導演模式——告訴 AI「誰在說、在哪說、怎麼說」→
老手秘訣:同一句話套不同標籤各生成一次、對比著聽,你會最快建立「標籤手感」。
關卡 3 · 導演模式
三行指令,讓 AI 全程入戲
學完你能:寫出讓 AI 全程入戲的三行導演指令。
情緒標籤管「這句話什麼感覺」,導演模式管「這個人是誰、在哪、怎麼說」。三行指令寫進「風格說明」欄(不會被唸出),台詞照常進輸入框。
聽聽導演模式的效果(白樺 · 深夜電台)
角色:深夜電台主持人 場景:凌晨的直播間 指導:壓低聲音,慢慢說
……城市睡了,我還在。
喜歡這個效果?去工作室用同款音色配音 →
誰在說話——身份決定音色質感與用詞習慣
角色:深夜電台主持人
在哪裡說——空間與時間感都會影響演出
場景:凌晨的直播間
怎麼說——語速、共鳴、氣聲等具體演出指導
指導:壓低聲音,慢慢說
風格說明欄(三行指令)
角色:(誰在說,例如:深夜電台主持人) 場景:(在哪說,例如:凌晨的直播間) 指導:(怎麼說,例如:壓低聲音,慢慢說)
台詞框(只放要念的話)
……城市睡了,我還在。
「風格說明」欄就是導演席——指令寫這裡,一個字都不會被念出;台詞框裡的每個字都會被念出。
角色:(誰在說,例如:深夜電台主持人) 場景:(在哪說,例如:凌晨的直播間) 指導:(怎麼說,例如:壓低聲音,慢慢說)
台詞
STEP 1 · 「風格說明」欄寫三行指令
動畫自動循環播放,可隨時暫停
想寫得更細?四維指導、4 個場景範例與翻車修復都在導演模式完全指南 →
老手秘訣:導演指令描述「演出方式」,別把台詞寫進指令;想要句級情緒,再用 (風格) 標籤疊加。
關卡 4 · 聲音設計
用一句描述捏出獨特嗓音
學完你能:用 1-4 句描述,讓設計精靈捏出獨特嗓音。
手邊沒有音檔?沒關係——聲音設計讓你用文字「捏」出一個前所未有的聲音。CharacterWizard 會帶你走完五步,動畫看這裡:
…
角色設定:這聲音是誰、用在哪
動畫自動循環播放,可隨時暫停
先想清楚這個聲音是誰:年齡、性別、個性、用途。描述控制在 1-4 句——太短 AI 瞎猜,太長互相打架。
選擇從零設計全新聲音,或以既有聲音特徵為基底進行混搭。
用文字刻畫音色,例如「30 歲男性、低沉沙啞、像深夜電台主持人」。年齡與音色必須具體,不會寫?套用內建描述模板再改,或讓 AI 潤色自動擴寫。
AI 依描述生成候選聲音。不滿意就調整描述再生成,多試幾輪直到命中為止。
滿意後命名保存,之後在文字轉語音的聲音列表就能直接選用。
好描述「60 歲老爺爺,聲音沙啞帶著笑意,語速偏慢,像在爐火邊說故事的爺爺。」
壞描述「一個老的聲音。」——太模糊,AI 只能瞎猜。
描述公式:職業+場景+比喻。「像深夜電台主持人」勝過「低頻、慢語速」的參數羅列。
老手秘訣:不滿意就改描述再生成——多輪迭代是常態,每輪只調一個變數(年齡/音色/語氣),最容易命中。
關卡 5 · 聲音克隆
5-30 秒素材複製任何聲音
學完你能:用 5-30 秒素材克隆一個聲音,並讓它吃標籤演出。
想讓 AI 說話像你(或你已授權的人)?聲音克隆只需要兩樣東西:一段乾淨音檔+對應的文字稿。
建議 5-30 秒的清晰錄音:環境安靜、距離麥克風穩定、語速自然。支援 MP3、WAV、FLAC 等常見格式。
把音檔裡說的內容打成文字一起提交。文字與語音內容越對齊,克隆的音色與韻律就越準。
送出後稍待片刻,新聲音會出現在聲音列表裡。取個好認的名字,之後在文字轉語音就能隨時呼叫。
STEP 1 · 上傳 5-30 秒乾淨音檔
動畫自動循環播放,可隨時暫停
克隆完成的聲音同樣吃標籤!加上 (悲傷) 或調高語速,一個聲音瞬間多種戲路——組合技見 Lv.8。
老手秘訣:克隆品質八成取決於素材。寧可花五分鐘重錄一段乾淨音檔,也不要拿吵雜的會議錄音硬上。
關卡 6 · 唱歌模式
(唱歌) 句首一放,開口就是歌
學完你能:一句 (唱歌),讓 AI 開口就是歌。
唱歌模式不需要找開關切換——在台詞最前面加上 (唱歌) 標籤,AI 就會帶著旋律感演出。
(唱歌)祝你生日快樂~祝你生日快樂~
(唱歌) 必須位於文本最開頭,整句生效。適合生日祝福、節目片頭、趣味問候。
片頭用唱歌模式唱一句 jingle,正文切回朗讀,結尾加 [笑]——三分鐘做出有記憶點的節目片頭。由於 (唱歌) 是整句生效,混搭做法是把唱段與念段分成兩段分別生成,再到剪輯軟體拼接。
聽聽看:(唱歌) 整句示範
喜歡這個效果?去工作室用同款音色配音 →
老手秘訣:配上 (開心) 等風格標籤可以疊加情緒;唱歌模式與滑桿語速共同作用,先聽預設再微調。
關卡 7 · 工程與品質
多版本迭代與分段配音
學完你能:穩定產出可交付的成品——多版本迭代、長文分段、素材管理。
「能用」跟「好作品」的距離,是一套工程習慣。這一關把隨手生成升級成可控生產線。
同一條提示詞,AI 每次演出都不一樣。重要台詞別只用第一版——連按三次生成,挑最自然的那版。聽聽這三版的差異(同一提示詞、三次獨立合成):
同一提示詞 · 三版對比
依段落或情緒切塊,每塊單獨生成
逐塊微調語速、音高與標籤
在剪輯軟體拼接——節奏掌控精準得多
克隆與設計的聲音都收藏在聲音列表,與內建聲音並列。點擊即可試聽,也能直接用於合成。
每次生成自動存檔,可回放、下載或刪除。需要找特定音檔時,用內容關鍵字搜尋最快。
儀表板的「用量」分頁即時顯示 Credits 餘額,快用完時記得升級方案。
老手秘訣:養成「生成完立刻下載」的習慣——歷史紀錄方便回顧,但原始音檔握在自己手裡最安心。
關卡 8 · 導播級心法
老手都在用的組合技
學完你能:把前面所有技能組合成導播級演出。
基礎關卡都通關了?這裡是老手都在用的組合技,來自重度玩家的實戰整理。
風格標籤可以疊加——「(開心)(耳語)」會產生開心卻壓低音量的神秘感。多試組合,你會挖出全新的聲音表情。
導演指令不夠味?在「指導」行加一個維度(共鳴/語速頓挫/氣實聲轉換/咬字),像調音台一樣精準——完整教學見導演模式完全指南。
刪節號「……」製造遲疑、驚嘆號拉高音量、問號帶出上揚語調。只改標點不改字,情緒立刻不同(Lv.2 有示範音檔)。
克隆出來的聲音同樣吃標籤!加上 (悲傷) 或調高語速,一個聲音瞬間多種戲路。
開頭用唱歌模式唱一句 jingle、正文切回朗讀、結尾加 [笑]——三分鐘做出有記憶點的節目片頭。
把成功的三行指令存進筆記,下次照抄微調。老手的速度,來自模板,不是來自每次從零想。
(激動)用體育主播的語氣播報——各位觀眾,最後十秒,球進了! (低沉)切換到深夜紀錄片旁白……這座城市,從來沒有真正睡著。 (溫柔)像給孩子說睡前故事一樣,放慢語速:於是,小狐狸悄悄闖進了森林。
老手秘訣:把好聽的參數組合(聲音+語速+音高+標籤)記在筆記裡,下次直接套用,品質穩定又省時。
三行指令逐字解剖、四維指導試聽、4 個場景照抄範例、翻車修復與迭代工作流——讀完就能寫出「會演戲」的指令。
免費方案每月約 30 分鐘語音,不用信用卡。