ElevenLabs(elevenlabs.io)是一家 AI 語音研究與產品公司的官方平台,2023 年 1 月以公開測試版上線。它要解決的核心問題是「讓機器開口說出接近真人的話」:輸入文字即可生成帶有情緒、語調與停頓感的語音,並把同一套能力延伸到聲音複製、跨語言配音、語音轉錄、音效與音樂生成,以及可接聽電話的對話式語音代理。與同類語音工具相比,它可查證的差異在於:自研旗艦模型 Eleven v3 涵蓋 70 多種語言,並支援以 [whispers]、[sighs] 這類音訊標籤直接控制語氣與非語言反應(官方發布說明);公司也將產品線明確劃分為面向創作者的 ElevenCreative、面向企業的 ElevenAgents,以及面向開發者的 ElevenAPI 三大平台(About 頁)。截至 2026-09-16,免費方案每月提供 10,000 點數,註冊即可使用。

站點速覽
- 網址:https://elevenlabs.io
- 類型:AI 語音合成與音訊創作平台(網頁應用 + API)
- 費用:免費方案 0 美元;付費方案 Starter 每月 6 美元、Creator 每月 22 美元、Pro 每月 99 美元,團隊方案 Scale 每月 299 美元起,Enterprise 另議(截至 2026-09-16 的官方定價頁)
- 註冊要求:瀏覽官網、文件與定價頁無需註冊;生成內容與呼叫 API 需要帳號(支援 Google 帳號登入)。官方條款也約束「未登入生成」的內容——公開發布時同樣必須署名(官方說明)
- 介面語言:英文(截至 2026-09-16,網站與文件皆無官方中文介面;生成的語音本身支援中文等 70 多種語言)
- 行動裝置:另有 iOS/Android 聽讀應用 ElevenReader,可朗讀文章、PDF 與 ePub(2024 年 6 月發布,見 Wikipedia 條目)
站點背景
ElevenLabs 於 2022 年由一對波蘭中學好友創立:執行長 Mati Staniszewski(先前任職 Palantir)與技術長 Piotr Dąbkowski(先前任職 Google)。官方 Press 頁提到,兩人年少時常吐槽美國電影在波蘭播放時的「粗糙配音」,多年後決定打造一個能消除內容語言障礙的平台;公司名稱中的 "Eleven" 指的是 11 月 11 日波蘭獨立日(Wikipedia 條目)。公司總部設於倫敦與紐約。
融資與規模的主要節點:
- 2023 年 1 月:公開測試版上線,同年上半年註冊使用者即突破 100 萬(Wikipedia 條目)。
- 2024 年 1 月:B 輪融資 8,000 萬美元,估值 11 億美元(Wikipedia 條目)。
- 2025 年 1 月:C 輪融資 1.8 億美元,估值 33 億美元(同上)。
- 2026 年 2 月 4 日:D 輪融資 5 億美元,估值 110 億美元,由 Sequoia Capital 領投(Andrew Reed 加入董事會),累計融資 7.81 億美元;官方同時披露 2025 年結束時年度經常性收入(ARR)超過 3.3 億美元。
客戶方面,官方稱 Deutsche Telekom、Square、烏克蘭政府、Revolut 等機構使用其語音代理;Duolingo、NVIDIA、TIME 使用其創意平台;Meta、Epic Games、Salesforce 等公司則透過其 API 觸及超過 10 億使用者(D 輪公告)。
語音合成:從文字到有情緒的聲音
模型與語言
官方模型文件(截至 2026-09-16)將語音合成模型分為幾個層級:
- Eleven v3:旗艦模型,支援 70 多種語言,可生成多人對話,並支援音訊標籤(在文字中插入
[whispers]、[laughs]等控制語氣與反應),單次請求上限 5,000 字元(約 5 分鐘音訊)。官方發布說明也提醒:它比舊模型更依賴提示詞技巧、延遲較高,不適合即時對話場景。 - Eleven v3 Conversational:面向即時對話的 v3 變體,官方標示延遲約 280 毫秒。
- Multilingual v2:支援 29 種語言,品質穩定,適合旁白與長篇內容。
- Flash v2.5:支援 32 種語言,延遲約 75 毫秒,面向即時應用與大規模批次生成,API 單價較低。

聲音庫、複製與聲音設計
不想複製聲音的使用者可以直接從聲音庫挑選:官方文件稱庫中已有超過 10,000 個聲音(官網 Text to Speech 頁面於 2026-09-16 標示為 11,000+)。取得「專屬聲音」的途徑有三種:
- Instant Voice Cloning(Starter 方案起):上傳簡短的音訊樣本即可複製;
- Professional Voice Cloning(Creator 方案起):以更多素材訓練高保真聲音,官方要求通過技術驗證後才開放使用(安全頁);
- Voice Design:直接用文字描述「設計」一個不存在的聲音。

配音、轉錄與工作室工具
- AI 配音(Dubbing):2023 年 10 月發布,可將影音內容翻譯成其他語言,並盡量保留原說話者的音色與情緒,發布時支援 20 多種語言(Wikipedia 條目);Starter 方案起另提供可逐句校對的 Dubbing Studio。
- 語音轉錄(Scribe):2025 年 2 月發布的首個轉錄模型,官方稱支援 99 種語言,具備字級時間戳、說話者分離與笑聲等音訊事件標記,並宣稱在 FLEURS、Common Voice 基準上字錯率低於 Gemini 2.0 Flash、Whisper Large V3 等模型(官方說法,見 Scribe 發布部落格)。目前的 Scribe v2 系列涵蓋 90 多種語言,即時版延遲約 150 毫秒,另有符合 HIPAA 要求的醫療版(模型文件)。
- 其他音訊工具:Voice Changer(變聲)、Sound Effects(文字生成音效)、Voice Isolator(人聲分離降噪)。
- Studio:面向有聲書等長音訊的專案編輯器,免費方案可建 3 個專案,Starter 方案 20 個(定價頁)。
音樂與其他生成能力
2025 年 8 月上線的 Eleven Music 以自然語言生成「錄音室等級」音樂,可控制流派、結構與人聲,官方稱與唱片公司、發行商及藝人合作開發,可在影視、播客、廣告、遊戲等場景商用(Wikipedia 條目、模型文件)。2026 年 9 月 10 日,ElevenLabs 宣布與環球音樂集團(UMG)達成多年授權與策略合作——這是其與大型唱片公司的首個協議,將基於授權曲庫推出面向粉絲的 AI 音樂創作平台(官方公告)。此外,About 頁與定價頁顯示 ElevenCreative 已擴展到圖像與影片生成,平台定位正從「語音」擴大為更寬的視聽創作。
對話代理與開發者介面
ElevenAgents 面向企業部署語音與聊天代理(客服、銷售、內部培訓等),提供視覺化編排,2026 年 2 月加入基於 v3 的 Expressive Mode,回應更快、語氣更自然(Wikipedia 條目);另有面向中小企業的 AI 電話前台 Reception AI(官方文件)。ElevenAPI 將上述能力以 REST 介面開放,提供官方 Python 與 TypeScript SDK、WebSocket 串流介面,以及 2026 年 8 月推出的命令列工具;併發上限依訂閱方案劃分(模型文件)。
帳號、額度與商用授權
平台統一以「點數(credits)」計量:文字轉語音 1 字元 = 1 點,其他產品依處理音訊的秒數計費;額度每月重置,未用完最多遞延兩個月(官方文件)。截至 2026-09-16 的定價頁:
| 方案 | 價格(月付) | 每月點數 | 主要差異 |
|---|---|---|---|
| Free | 0 美元 | 10,000 | 語音合成、轉錄、音效、音樂等基礎能力;3 個 Studio 專案;無商用授權 |
| Starter | 6 美元 | 30,000 | 商用授權、即時聲音複製、Dubbing Studio、20 個 Studio 專案 |
| Creator | 22 美元(首月半價 11 美元) | 121,000 | 專業聲音複製 |
| Pro | 99 美元 | 600,000 | API 輸出 44.1kHz PCM、192kbps 音質 |
| Scale / Business | 299 / 990 美元 | 180 萬 / 600 萬 | 3 / 10 個團隊席位、更多專業聲音複製數 |
| Enterprise | 另議 | 另議 | DPA/SLA、HIPAA BAA、自訂 SSO、更高併發 |

授權規則需要特別留意(官方說明):免費方案或未登入生成的內容不得商用,公開發布時必須在標題署名 "elevenlabs.io" 或 "11.ai"(音樂內容標註 "Eleven Music");所有付費方案皆附商用授權,訂閱期間生成的內容可長期商用;測試中的 Beta 功能產出不得用於商用或生產環境。新創公司另有 Startup Grants 計畫:入選後 12 個月免費,含 3,300 萬字元額度。
安全機制與內容政策
聲音複製的濫用風險是這類平台無法迴避的問題。官方安全頁描述了四層機制:預防(模型發布前紅隊測試、註冊審核、封鎖名人等高風險聲音的複製、專業複製需技術驗證)、偵測(AI 分類器與人工審核並行,並設公開檢舉管道)、處置(封禁違規帳號、涉嫌違法的移交執法機關)、知情(為生成內容附加 C2PA 來源標識,並公開 AI Speech Classifier 供任何人檢測音訊是否出自 ElevenLabs)。
官方同時坦承「沒有安全系統是完美的」:2023 年初上線數週內,即出現使用者以其工具偽造名人言論的事件;2024 年美國新罕布什爾州初選期間的「拜登語音」自動電話,也被音訊專家指認使用了其工具生成(Wikipedia 條目)。
適用場景
- 影片、播客、有聲書的旁白與角色配音,特別是需要多語言版本的團隊;
- 需要將內容快速本地化成數十種語言的創作者與媒體(配音與轉錄一次完成);
- 遊戲與互動內容的角色語音、即時語音對話(Flash v2.5 / v3 Conversational 低延遲模型);
- 開發者將語音合成、轉錄與代理能力嵌入自有產品(API / SDK / CLI);
- 無障礙場景:官方 Impact 計畫向有無障礙需求的個人與公益機構提供免費授權,並於 2026 年 3 月承諾投入價值 10 億美元,為 100 萬永久失聲者重建聲音(Wikipedia 條目)。
局限
- 免費方案不能商用:這是最容易誤踩的規則——免費方案或未登入生成的內容發布時必須署名且不得商用;要商用至少需每月 6 美元的 Starter 方案。
- 介面僅英文:截至 2026-09-16,網頁與文件皆無官方中文介面,上手需要一定的英文閱讀能力(生成的語音支援中文)。
- 額度計費需要適應:點數按月重置、最多遞延兩個月;不同模型與產品的消耗速率不同,長內容需依單次請求上限拆分(v3 為 5,000 字元),重度使用會快速推高方案成本。
- v3 更「難駕馭」:官方發布說明提示其需要更多提示詞調試且延遲較高;即時場景應改用 Flash v2.5 或 v3 Conversational。
- 閉源 SaaS:模型不開放權重,只能透過網頁與 API 使用,品質、可用性與成本都綁定單一供應商。
- 濫用與合規爭議:聲音複製天然伴隨偽造風險,平台過去多次捲入深度偽造事件;將他人聲音複製用於商用前,需自行確認授權鏈是否完整。
同類參考
與本目錄已收錄的 Suno 側重「生成完整歌曲」不同,ElevenLabs 的主線是語音,音樂只是其創意平台的一部分。傳統雲端廠商的 TTS 服務(Amazon Polly、Google Cloud Text-to-Speech、Azure 語音合成)定位更接近基礎設施;語音生成領域內還有 PlayHT、Murf、Speechify 等產品,各自側重不同場景。
參考資料
- ElevenLabs About、Press、Safety(2026-09-16 查證)
- Pricing 與發布內容授權說明(2026-09-16 查證)
- Docs:Overview、Models(2026-09-16 查證)
- 官方部落格:Series D、Eleven v3、Meet Scribe、UMG 合作
- Wikipedia:ElevenLabs(2026-09-16 查證,用於早期歷史與爭議事件交叉核實)







