官方玩家手冊

Soundwaver 使用攻略

從第一段語音到導演級演出——8 個關卡的完整闖關手冊,每一步都有可照抄的腳本與避坑清單,把「能出聲」練成「會演戲」。

中英雙語

模型與介面

8+

預置音色

30 秒

完成聲音克隆

秒級

文字變語音

預計通關時間: 約 15 分鐘

免費方案每月約 30 分鐘語音,不用信用卡。

1

關卡 1 · 快速上手

快速上手

3 步生成你的第一段語音

學完你能:一分鐘內生成第一段語音。

第一次來到 Soundwaver?照著動畫與三步走,一分鐘內就能聽到 AI 幫你開口說話。

跟著動畫生成第一段語音

台詞

生成試聽

STEP 1 · 台詞框輸入你想說的話

動畫自動循環播放,可隨時暫停

1

進入工作室

點擊右上角「工作室」,你會看到三大功能分頁。新手先留在「文字轉語音」就好,其他關卡稍後再解鎖。

不用安裝任何軟體,打開瀏覽器就能開工。

2

輸入文字、挑個聲音

在輸入框打下任何句子,再從聲音列表選一個喜歡的嗓音。中文推薦晴晴(活潑)、柔柔(溫柔),英文試試 Aria。

滑桿可調語速(10-200%)與音高,先用預設值,聽熟了再微調。

3

點擊生成、試聽下載

按下生成按鈕,幾秒內就能試聽。滿意的話直接下載 WAV 或 MP3,馬上能用在你的影片、簡報或 Podcast 裡。

生成紀錄會自動存進歷史頁,手滑關掉也不怕。

第一句就出彩:標點就是演技

生成前先檢查標點——「……」製造遲疑、「!」拉高音量、「?」帶出上揚語調。只改標點不改字,情緒立刻不同。

學會了?把第一段語音帶進工作室馬上試。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:重要台詞多生成幾版再挑——同一輸入每次演出都不同(詳見 Lv.7 工程與品質)。

2

關卡 2 · 文字轉語音

文字轉語音

讓 AI 演出情緒,不是唸稿

學完你能:用標籤與標點,讓同一句話演出完全不同的情緒。

文字轉語音不只是「唸稿機」。看懂操作面板、學會標籤咒語與標點演技,它能替你演出整齣戲。

先認識操作面板

聲音選擇

內建聲音各有語言與個性——中文有晴晴、柔柔、磊磊、沉風;英文有 Aria、Luna、Rex、Cole。

語速滑桿

10% 到 200% 自由調整。旁白建議 90-110%,快節奏廣告可以拉到 130%。

音高滑桿

想要低沉磁性就往下調,可愛童聲往上調,搭配語速一起微調效果最自然。

唱歌模式

切換後 AI 會帶著旋律感演出,適合 jingle、生日祝福或趣味短片內容。

標籤系統:配音的魔法咒語

在文字裡插入標籤,就能直接指揮 AI 的情緒與呼吸。只要記住兩種寫法:

(風格/語言標籤)→ 放在句首

用小括號包住、寫在句子最前面,可以疊加多個,決定整句的演技基調。

(開心)(耳語)(悲傷)(憤怒)(英文)

(興奮)我們贏了!這場比賽實在太精彩了!

[音訊標籤] → 接在句尾

用方括號包住、附在句尾,控制停頓、氣口與擬真音效。

[停頓][嘆氣][笑][呼吸]

這個消息真是令人難以置信[嘆氣]讓我緩一緩。

跟著動畫加標籤:同一句話兩種演技

台詞

生成試聽

先打好台詞

動畫自動循環播放,可隨時暫停

互動沙盒:不註冊就能玩

點標籤加進台詞,按「生成」立刻聽結果——這就是工作室的核心體驗。

互動試煉場

點一個標籤加進台詞裡,感受 AI 演技的變化!

歡迎來到 Soundwaver,這裡是聲音的遊樂場。 ← 點擊標籤試試

( ) 風格/語言標籤

[ ] [音訊標籤]

點擊標籤會立刻合成並播放,先聽為快!

標點符號就是演技

只改標點、不改字,AI 會演出完全不同的語氣——省略號遲疑低回,驚嘆號瞬間爆發。聽聽這組對比:

喜歡這個效果?去工作室用同款音色配音 →

老手秘訣:合成小秘诀:送進 WaveMind 的文字與標籤本身用簡體中文寫(如 (开心)、[叹气])——WaveMind 對繁體字的發音與標籤辨識較不穩定。頁面顯示照常用繁體即可。

進階玩法:導演模式——告訴 AI「誰在說、在哪說、怎麼說」→

把這句標籤腳本帶進工作室,聽 AI 現場演出。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:同一句話套不同標籤各生成一次、對比著聽,你會最快建立「標籤手感」。

3

關卡 3 · 導演模式

導演模式

三行指令,讓 AI 全程入戲

學完你能:寫出讓 AI 全程入戲的三行導演指令。

情緒標籤管「這句話什麼感覺」,導演模式管「這個人是誰、在哪、怎麼說」。三行指令寫進「風格說明」欄(不會被唸出),台詞照常進輸入框。

聽聽導演模式的效果(白樺 · 深夜電台)

角色:深夜電台主持人
場景:凌晨的直播間
指導:壓低聲音,慢慢說
……城市睡了,我還在。

喜歡這個效果?去工作室用同款音色配音 →

三行指令解剖

1

角色

誰在說話——身份決定音色質感與用詞習慣

角色:深夜電台主持人
2

場景

在哪裡說——空間與時間感都會影響演出

場景:凌晨的直播間
3

指導

怎麼說——語速、共鳴、氣聲等具體演出指導

指導:壓低聲音,慢慢說

填在哪裡?

風格說明欄(三行指令)

角色:(誰在說,例如:深夜電台主持人)
場景:(在哪說,例如:凌晨的直播間)
指導:(怎麼說,例如:壓低聲音,慢慢說)

台詞框(只放要念的話)

……城市睡了,我還在。

「風格說明」欄就是導演席——指令寫這裡,一個字都不會被念出;台詞框裡的每個字都會被念出。

可照抄模板

角色:(誰在說,例如:深夜電台主持人)
場景:(在哪說,例如:凌晨的直播間)
指導:(怎麼說,例如:壓低聲音,慢慢說)

跟著動畫用導演模式

台詞

生成試聽

STEP 1 · 「風格說明」欄寫三行指令

動畫自動循環播放,可隨時暫停

想寫得更細?四維指導、4 個場景範例與翻車修復都在導演模式完全指南 →

免費方案就能用導演模式——模板已幫你寫好。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:導演指令描述「演出方式」,別把台詞寫進指令;想要句級情緒,再用 (風格) 標籤疊加。

4

關卡 4 · 聲音設計

聲音設計

用一句描述捏出獨特嗓音

學完你能:用 1-4 句描述,讓設計精靈捏出獨特嗓音。

手邊沒有音檔?沒關係——聲音設計讓你用文字「捏」出一個前所未有的聲音。CharacterWizard 會帶你走完五步,動畫看這裡:

跟著動畫走完設計精靈五步

1角色設定
2聲音來源
3人物設定
4生成試聽
5保存角色

角色設定:這聲音是誰、用在哪

動畫自動循環播放,可隨時暫停

1

角色設定

先想清楚這個聲音是誰:年齡、性別、個性、用途。描述控制在 1-4 句——太短 AI 瞎猜,太長互相打架。

2

聲音來源

選擇從零設計全新聲音,或以既有聲音特徵為基底進行混搭。

3

人物設定

用文字刻畫音色,例如「30 歲男性、低沉沙啞、像深夜電台主持人」。年齡與音色必須具體,不會寫?套用內建描述模板再改,或讓 AI 潤色自動擴寫。

4

生成試聽

AI 依描述生成候選聲音。不滿意就調整描述再生成,多試幾輪直到命中為止。

5

保存角色

滿意後命名保存,之後在文字轉語音的聲音列表就能直接選用。

好描述「60 歲老爺爺,聲音沙啞帶著笑意,語速偏慢,像在爐火邊說故事的爺爺。」

壞描述「一個老的聲音。」——太模糊,AI 只能瞎猜。

三個常見地雷
  • • 只寫性別不寫年齡音色(如「一個女的」),AI 只能隨機猜
  • • 堆砌衝突形容詞(又低沉又清亮又活潑),反而互相抵銷
  • • 把舞台指示寫進描述(如「請用激動語氣」),描述應該形容聲音本身
  • • 堆砌混響、EQ、頻段等專業術語——用比喻描述聽感更有效

描述公式:職業+場景+比喻。「像深夜電台主持人」勝過「低頻、慢語速」的參數羅列。

想深入了解背後的 WaveMind™ 語音引擎 →

把你的描述帶進設計精靈,兩分鐘捏出專屬聲音。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:不滿意就改描述再生成——多輪迭代是常態,每輪只調一個變數(年齡/音色/語氣),最容易命中。

5

關卡 5 · 聲音克隆

聲音克隆

5-30 秒素材複製任何聲音

學完你能:用 5-30 秒素材克隆一個聲音,並讓它吃標籤演出。

想讓 AI 說話像你(或你已授權的人)?聲音克隆只需要兩樣東西:一段乾淨音檔+對應的文字稿。

1

準備乾淨的音檔

建議 5-30 秒的清晰錄音:環境安靜、距離麥克風穩定、語速自然。支援 MP3、WAV、FLAC 等常見格式。

2

上傳音檔+文字稿

把音檔裡說的內容打成文字一起提交。文字與語音內容越對齊,克隆的音色與韻律就越準。

3

生成並命名你的聲音

送出後稍待片刻,新聲音會出現在聲音列表裡。取個好認的名字,之後在文字轉語音就能隨時呼叫。

跟著動畫完成聲音克隆

STEP 1 · 上傳 5-30 秒乾淨音檔

動畫自動循環播放,可隨時暫停

推薦做法

  • 錄音環境安靜,沒有回音與雜音
  • 音檔內容清晰、語速自然
  • 事先取得聲音主人的明確授權
  • 文字稿與音檔說的內容一致

避坑指南

  • 背景混著音樂、風扇或鍵盤聲
  • 素材太短(低於 5 秒)或剪得太碎
  • 未經同意克隆他人聲音
  • 使用變聲器處理過的音檔

克隆完成的聲音同樣吃標籤!加上 (悲傷) 或調高語速,一個聲音瞬間多種戲路——組合技見 Lv.8。

素材備好了?工作室上傳即可開始克隆。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:克隆品質八成取決於素材。寧可花五分鐘重錄一段乾淨音檔,也不要拿吵雜的會議錄音硬上。

6

關卡 6 · 唱歌模式

唱歌模式

(唱歌) 句首一放,開口就是歌

學完你能:一句 (唱歌),讓 AI 開口就是歌。

唱歌模式不需要找開關切換——在台詞最前面加上 (唱歌) 標籤,AI 就會帶著旋律感演出。

怎麼用

(唱歌)祝你生日快樂~祝你生日快樂~

(唱歌) 必須位於文本最開頭,整句生效。適合生日祝福、節目片頭、趣味問候。

jingle 配方:唱頭+念尾

片頭用唱歌模式唱一句 jingle,正文切回朗讀,結尾加 [笑]——三分鐘做出有記憶點的節目片頭。由於 (唱歌) 是整句生效,混搭做法是把唱段與念段分成兩段分別生成,再到剪輯軟體拼接。

三個常見地雷
  • • (唱歌) 必須放句首,不能插在句子中間
  • • 一次唱整句——不做「念唱混排」(如「祝你(唱歌)生日快樂」)
  • • 長歌詞逐段生成,品質更穩

聽聽看:(唱歌) 整句示範

喜歡這個效果?去工作室用同款音色配音 →

把 jingle 配方帶進工作室,唱給大家聽。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:配上 (開心) 等風格標籤可以疊加情緒;唱歌模式與滑桿語速共同作用,先聽預設再微調。

7

關卡 7 · 工程與品質

工程與品質

多版本迭代與分段配音

學完你能:穩定產出可交付的成品——多版本迭代、長文分段、素材管理。

「能用」跟「好作品」的距離,是一套工程習慣。這一關把隨手生成升級成可控生產線。

同輸入≠同輸出:多生成幾版挑最好

同一條提示詞,AI 每次演出都不一樣。重要台詞別只用第一版——連按三次生成,挑最自然的那版。聽聽這三版的差異(同一提示詞、三次獨立合成):

同一提示詞 · 三版對比

長文分段配音

1

依段落或情緒切塊,每塊單獨生成

2

逐塊微調語速、音高與標籤

3

在剪輯軟體拼接——節奏掌控精準得多

素材管理

自訂聲音庫

克隆與設計的聲音都收藏在聲音列表,與內建聲音並列。點擊即可試聽,也能直接用於合成。

歷史紀錄

每次生成自動存檔,可回放、下載或刪除。需要找特定音檔時,用內容關鍵字搜尋最快。

用量監控

儀表板的「用量」分頁即時顯示 Credits 餘額,快用完時記得升級方案。

還沒有自己的聲音?先看 30 秒聲音克隆教學 →

用歷史紀錄管好每一版,挑出最滿意的那版。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:養成「生成完立刻下載」的習慣——歷史紀錄方便回顧,但原始音檔握在自己手裡最安心。

8

關卡 8 · 導播級心法

導播級心法

老手都在用的組合技

學完你能:把前面所有技能組合成導播級演出。

基礎關卡都通關了?這裡是老手都在用的組合技,來自重度玩家的實戰整理。

1

標籤疊加演出法

風格標籤可以疊加——「(開心)(耳語)」會產生開心卻壓低音量的神秘感。多試組合,你會挖出全新的聲音表情。

2

四維指導加戲

導演指令不夠味?在「指導」行加一個維度(共鳴/語速頓挫/氣實聲轉換/咬字),像調音台一樣精準——完整教學見導演模式完全指南。

3

標點符號就是演技

刪節號「……」製造遲疑、驚嘆號拉高音量、問號帶出上揚語調。只改標點不改字,情緒立刻不同(Lv.2 有示範音檔)。

4

克隆聲音 × 標籤 = 專屬聲優

克隆出來的聲音同樣吃標籤!加上 (悲傷) 或調高語速,一個聲音瞬間多種戲路。

5

唱段與效果音混搭

開頭用唱歌模式唱一句 jingle、正文切回朗讀、結尾加 [笑]——三分鐘做出有記憶點的節目片頭。

6

場景模板庫

把成功的三行指令存進筆記,下次照抄微調。老手的速度,來自模板,不是來自每次從零想。

導演模式完整示例

(激動)用體育主播的語氣播報——各位觀眾,最後十秒,球進了!
(低沉)切換到深夜紀錄片旁白……這座城市,從來沒有真正睡著。
(溫柔)像給孩子說睡前故事一樣,放慢語速:於是,小狐狸悄悄闖進了森林。

通關檢查清單0/5

心法已傳授,工作室就是你的道場。

免費方案每月約 30 分鐘語音,不用信用卡。

老手秘訣:把好聽的參數組合(聲音+語速+音高+標籤)記在筆記裡,下次直接套用,品質穩定又省時。

深水區

導演模式完全指南

三行指令逐字解剖、四維指導試聽、4 個場景照抄範例、翻車修復與迭代工作流——讀完就能寫出「會演戲」的指令。

進入導演模式指南

前往工作室實戰

免費方案每月約 30 分鐘語音,不用信用卡。

先看定價