2026-06 多輪 deep-research 整理。✅=官方查證 · ⚠️=待確認/我的認知。現況:Starter $6/月、30k credits、已用音效 API。
| 模型 | 語言 | 中文 | credit/字 | 定位 |
|---|---|---|---|---|
eleven_v3 | 74 | ✅ | 1 | 情緒最強(audio tags) |
multilingual_v2 | 29 | ✅ | 1 | 最擬真,官方推薦有聲書/旁白 |
flash_v2.5 | 32 | ✅ | 0.5 | 超低延遲,量產省一半 |
turbo_v2.5 | 32 | ✅ | 0.5 | 速度品質平衡 |
• API 生成比網站便宜:v2/v3 ≈ $0.10/1K 字、Flash/Turbo ≈ $0.05/1K 字。
• 同字數下 V2=V3 同價,Flash/Turbo 半價但情緒較弱。
v3 audio tags(句中方括號逐句指揮):[excited] [whispers] [nervous] [laughs] [pauses] [cheerfully]。⚠️ 跨聲線一致性差,上線前要測。
| v3 stability 模式 | 特性 | 繪本用 |
|---|---|---|
| Creative | 情緒最強,但易亂念/幻覺 | 角色戲劇台詞 |
| Natural | 最接近原聲、平衡 | 平穩旁白 |
| Robust | 最穩但忽略 audio tags(近 v2) | 長段不出錯 |
voice_settings(所有模型可調):stability(穩定↔表現)、similarity_boost(貼近原聲)、style(風格強度)、use_speaker_boost。台灣腔聲線靠這些調情緒(非 v3 tags)。
| IVC 即時克隆 | PVC 專業克隆 | |
|---|---|---|
| 方案 | Starter 就有 | Creator+(Scale 3 個/Business 10 個) |
| 樣本 | ~1 分鐘 | 數十分鐘~數小時 ⚠️ |
| 等待 | 秒級 | 數小時訓練 |
| 品質 | 夠用 | 更高更像 |
| v3 | ✅ 官方建議搭 v3 | ⚠️ 未最佳化、品質會掉 |
PVC 流程:① 升 Creator → ② 身分/同意驗證(錄指定語句比對)→ ③ 上傳大量乾淨一致樣本 → ④ 等數小時訓練(webhook 通知)→ ⑤ 用於 TTS(走 v2/v2.5)。
Voice Design:用文字描述生成全新聲音(不需樣本)。
→ 要 v3 情緒就用 IVC 或 Voice Design,別用 PVC;童聲(沐夏)無論哪種都要先有真小孩乾淨錄音。
共享聲線庫實撈 124 個中文腔(試聽頁可聽):台灣腔 26、標準華語 67、北京腔 22、香港粵語 7、新加坡 2。
⚠️ 台灣腔 26 個裡 25 個是 PVC、只驗證在 v2/v2.5(沒驗證 v3)→ 台灣腔走 multilingual_v2 / turbo v2.5,別預設 v3。 → 開試聽頁挑聲線
POST /v1/sound-generation(model eleven_text_to_sound_v2)
| 參數 | 說明 |
|---|---|
text | 必填 |
duration_seconds | 0.5–30;不給=AI 自動 |
prompt_influence | 0–1,預設 0.3(越高越貼提示) |
loop | bool,v2 才有,無縫循環(環境底音) |
| 輸出 | v2 上限 30s、48kHz;API 每次回 1 個(網頁 4) |
💰 計費:AI 自動時長 = 100 credits/次;自訂時長 = 20 credits/秒(網頁是 40,API 半價)。
省錢:短擬聲(2s)自訂=40cr 比自動 100 省;長環境音用 loop=true+短秒數,播放端重複,別生 9s(=180cr)。
prompt 技巧:自然語言+音訊術語+材質/動作/品質,如 high-quality, professionally recorded footsteps on grass, foley。
真有正式產品 + API(付費訂閱可用,Starter 符合):POST /v1/music(prompt)、POST /v1/music/detailed(composition_plan,二選一)。
force_instrumental=true → 保證純演奏(BGM/主題曲),但只能配 promptmusic_length_ms 3秒–10 分鐘(API)/ 5 分(網頁);風格/BPM 走文字 prompt;按秒計費⚠️ Music v2(最好)還沒上 API(coming soon),今天 API 用 v1 代 → 建議現階段維持自有 Stable Audio palette,等 v2 上 API 再評估。
POST /v1/text-to-speech/{voice_id}(+ /stream 串流、+ websocket 即時)text、model_id、voice_settings{stability,similarity_boost,style,use_speaker_boost}elevenlabs:client.text_to_speech.convert(...)→ 接進 build_enhanced_audio.py:加一支 elevenlabs_tts(text, voice_id, model_id, voice_settings) 即可,跟音效同一支腳本/.env。
可把自己的聲音上架共享聲線庫,別人用時依使用量領回饋(現金 USD 或平台 credits)。
| 方案 | 月費 | credits/月 | 商用授權 |
|---|---|---|---|
| Free | $0 | 10,000 | ❌ |
| Starter(你) | $6 | 30,000 | ✅ |
| Creator | $11(首月)/$22 | 121,000 | ✅ |
| Pro | $99 | 600,000 | ✅ |
超量:Starter 不能超量(用完停、等月初重置);Creator+ 可開 usage-based billing($0.30/1K credits 起)。商用授權 Starter 起。
① 角色配音:台灣腔走 multilingual_v2(表現力)或 turbo v2.5(省一半);要濃情緒且願自建 IVC 才上 v3。
② 省 credit 三招:量產用 Flash/Turbo v2.5(0.5/字)→ 走 API(再便宜)→ 數集/月就升 Creator 121k。
③ 音效:環境音用 loop=true+短秒數省一半;擬聲短秒自訂。
④ 配樂:維持自有 Stable Audio palette,等 ElevenLabs Music v2 上 API 再評估。
⑤ 多語化:Dubbing 可一鍵配英日(成本/品質待查)。
⑥ 字幕:Forced Alignment 出逐字時間戳,可做逐字高亮。
⑦ 每集成本:旁白 1,022 字 → v2 ≈ 1,000cr、Flash ≈ 500cr;Starter 30k ≈ 23~46 集/月。
註:API 端點/credit 數會變動,整合前以官方 docs 為準。Dubbing / STT / voice isolation / forced alignment 細節本筆記尚未深查。