ElevenLabs(elevenlabs.io)是一家 AI 语音研究与产品公司的官方平台,2023 年 1 月以公开测试版上线。它解决的核心问题是"让机器开口说出接近真人的话":输入文字即可生成带情绪、语调和停顿感的语音,并把同一能力延伸到声音克隆、跨语言配音、语音转写、音效与音乐生成,以及可接听电话的对话式语音智能体。与同类语音工具相比,它的可核实差异在于:自研旗舰模型 Eleven v3 覆盖 70 多种语言,支持用 [whispers]、[sighs] 这类音频标签直接控制语气与非语言反应(官方发布说明);公司把产品线明确划分为面向创作者的 ElevenCreative、面向企业的 ElevenAgents 和面向开发者的 ElevenAPI 三个平台(About 页)。截至 2026-09-16,免费档每月提供 10,000 信用点,注册即可使用。

ElevenLabs 首页:主标语「Bringing technology to life」,下方是 ElevenCreative、ElevenAgents、ElevenAPI 三平台入口与声音分类

站点速览

  • 网址:https://elevenlabs.io
  • 类型:AI 语音合成与音频创作平台(网页应用 + API)
  • 费用:免费档 0 美元;付费档 Starter 6 美元/月、Creator 22 美元/月、Pro 99 美元/月,团队档 Scale 299 美元/月起,Enterprise 定制报价(截至 2026-09-16 的官方定价页)
  • 注册要求:浏览官网、文档与定价页无需注册;生成内容与调用 API 需要账号(支持 Google 账号登录)。官方条款也约束"未登录生成"的内容——公开发布时同样必须署名(官方说明)
  • 界面语言:英文(截至 2026-09-16,站点与文档无官方中文界面;生成的语音本身支持中文等 70 多种语言)
  • 移动端:另有 iOS/Android 听读应用 ElevenReader,可朗读文章、PDF 与 ePub(2024 年 6 月发布,见 Wikipedia 词条)

站点背景

ElevenLabs 2022 年由一对波兰中学好友创立:CEO Mati Staniszewski(此前在 Palantir)与 CTO Piotr Dąbkowski(此前在 Google)。官方 Press 页称,两人年少时经常吐槽美国电影在波兰播放时的"粗糙配音",多年后决定做一个能消除内容语言障碍的平台;公司名中的 "Eleven" 指 11 月 11 日波兰独立日(Wikipedia 词条)。公司总部设在伦敦与纽约。

融资与规模的主要节点:

  • 2023 年 1 月:公开测试版上线,当年上半年注册用户即超过 100 万(Wikipedia 词条)。
  • 2024 年 1 月:8,000 万美元 B 轮融资,估值 11 亿美元(Wikipedia 词条)。
  • 2025 年 1 月:1.8 亿美元 C 轮融资,估值 33 亿美元(同上)。
  • 2026 年 2 月 4 日:5 亿美元 D 轮融资,估值 110 亿美元,由 Sequoia Capital 领投(Andrew Reed 加入董事会),累计融资 7.81 亿美元;官方同时披露 2025 年结束时年度经常性收入(ARR)超过 3.3 亿美元。

客户侧,官方称 Deutsche Telekom、Square、乌克兰政府、Revolut 等机构使用其语音智能体;Duolingo、NVIDIA、TIME 使用创意平台;Meta、Epic Games、Salesforce 等公司通过其 API 触达超过 10 亿用户(D 轮公告)。

语音合成:从文本到有情绪的语音

模型与语言

官方模型文档(截至 2026-09-16)把语音合成模型分为几档:

  • Eleven v3:旗舰模型,70 多种语言,支持多人对话生成与音频标签(在文本中插入 [whispers]、[laughs] 等控制语气与反应),单次请求上限 5,000 字符(约 5 分钟音频)。官方发布说明同时提醒:它比旧模型更依赖提示词技巧、延迟更高,不适合实时对话场景。
  • Eleven v3 Conversational:面向实时对话的 v3 变体,官方标注延迟约 280 毫秒。
  • Multilingual v2:支持 29 种语言,质量稳定,适合旁白与长内容。
  • Flash v2.5:支持 32 种语言,延迟约 75 毫秒,面向实时应用与大规模批量生成,API 单价更低。

ElevenLabs 的 Text to Speech 页面:左侧按旁白、角色、对话等用途筛选,右侧是可选声音列表

声音库、克隆与声音设计

不想克隆声音的用户可以直接从声音库挑选:官方文档称库中已有超过 10,000 个声音(官网 Text to Speech 页面 2026-09-16 标注为 11,000+)。获得"专属声音"的路径有三条:

  • Instant Voice Cloning(Starter 档起):上传较短的音频样本即可克隆;
  • Professional Voice Cloning(Creator 档起):用更多素材训练高保真声音,官方要求通过技术验证后才开放使用(安全页);
  • Voice Design:直接用文字描述"设计"一个不存在的声音。

Voice Library 页面:可按场景浏览库中声音,页面标注「10,000+ studio quality voices」

配音、转写与工作室工具

  • AI 配音(Dubbing):2023 年 10 月发布,把音视频内容翻译成其他语言,并尽量保留原说话人的音色与情绪,发布时支持 20 多种语言(Wikipedia 词条);Starter 档起另提供可逐句校对的 Dubbing Studio。
  • 语音转写(Scribe):2025 年 2 月发布的首个转写模型,官方称支持 99 种语言,带词级时间戳、说话人分离与笑声等音频事件标记,并宣称在 FLEURS、Common Voice 基准上词错误率低于 Gemini 2.0 Flash、Whisper Large V3 等模型(官方口径,见 Scribe 发布博客)。当前 Scribe v2 系列覆盖 90 多种语言,实时版延迟约 150 毫秒,另有符合 HIPAA 要求的医疗版(模型文档)。
  • 其他音频工具:Voice Changer(变声)、Sound Effects(文字生成音效)、Voice Isolator(人声分离降噪)。
  • Studio:面向有声书等长音频的项目编辑器,免费档可建 3 个项目,Starter 档 20 个(定价页)。

音乐与其他生成能力

2025 年 8 月上线的 Eleven Music 用自然语言生成"录音室级"音乐,可控流派、结构与人声,官方称与唱片公司、发行商及艺人合作开发,可在影视、播客、广告、游戏等场景商用(Wikipedia 词条、模型文档)。2026 年 9 月 10 日,ElevenLabs 宣布与环球音乐集团(UMG)达成多年授权与战略合作——这是其与大型唱片公司的首个协议,将基于授权曲库推出面向粉丝的 AI 音乐创作平台(官方公告)。此外,About 页与定价页显示 ElevenCreative 已扩展到图像与视频生成,平台定位正从"语音"扩展为更宽的视听创作。

对话智能体与开发者接口

ElevenAgents 面向企业部署语音与聊天智能体(客服、销售、内部培训等),提供可视化编排,2026 年 2 月加入基于 v3 的 Expressive Mode,响应更快、语气更自然(Wikipedia 词条);另有面向中小企业的 AI 电话前台 Reception AI(官方文档)。ElevenAPI 把上述能力以 REST 接口开放,提供官方 Python 与 TypeScript SDK、WebSocket 流式接口,以及 2026 年 8 月推出的命令行工具;并发上限按订阅档位划分(模型文档)。

账号、额度与商用授权

平台统一用"信用点(credits)"计量:文本转语音 1 字符 = 1 信用点,其他产品按处理音频的秒数计费;额度每月重置,未用完最多结转两个月(官方文档)。截至 2026-09-16 的定价页:

档位 价格(月付) 每月信用点 关键差异
Free 0 美元 10,000 语音合成、转写、音效、音乐等基础能力;3 个 Studio 项目;无商用授权
Starter 6 美元 30,000 商用授权、即时声音克隆、Dubbing Studio、20 个 Studio 项目
Creator 22 美元(首月半价 11 美元) 121,000 专业声音克隆
Pro 99 美元 600,000 API 输出 44.1kHz PCM、192kbps 音质
Scale / Business 299 / 990 美元 180 万 / 600 万 3 / 10 个团队席位、更多专业声音克隆数
Enterprise 定制 定制 DPA/SLA、HIPAA BAA、定制 SSO、更高并发

ElevenLabs 定价页:Free、Starter、Creator、Pro 四个自助档位及各自额度

授权规则需要特别注意(官方说明):免费档或未登录生成的内容不得商用,公开发布时必须在标题中署名 "elevenlabs.io" 或 "11.ai"(音乐内容标注 "Eleven Music");所有付费档均含商用授权,订阅期间生成的内容可长期商用;测试中的 Beta 功能产出不得用于商用或生产环境。创业公司另有 Startup Grants 计划:入选后 12 个月免费,含 3,300 万字符额度。

安全机制与内容政策

语音克隆的滥用风险是这类平台绕不开的问题。官方安全页描述了四层机制:预防(模型发布前红队测试、注册审核、屏蔽名人等高风险声音的克隆、专业克隆需技术验证)、检测(AI 分类器与人工审核结合,并设公开举报渠道)、处置(封禁违规账号、涉嫌违法的移交执法部门)、知情(为生成内容附加 C2PA 来源标识,并公开 AI Speech Classifier 供任何人检测音频是否出自 ElevenLabs)。

官方同时坦承"没有安全系统是完美的":2023 年初上线数周内,即出现用户用其工具伪造名人言论的事件;2024 年美国新罕布什尔州初选期间的"拜登语音"机器人电话,也被音频专家指认使用了其工具生成(Wikipedia 词条)。

适用场景

  • 视频、播客、有声书的旁白与角色配音,尤其是需要多语言版本的团队;
  • 需要把内容快速本地化成数十种语言的创作者与媒体(配音与转写一体完成);
  • 游戏与互动内容的角色语音、实时语音对话(Flash v2.5 / v3 Conversational 低延迟模型);
  • 开发者把语音合成、转写与智能体能力嵌入自有产品(API / SDK / CLI);
  • 无障碍场景:官方 Impact 计划向有无障碍需求的个人与公益机构提供免费授权,并于 2026 年 3 月承诺投入价值 10 亿美元,为 100 万永久失声者重建声音(Wikipedia 词条)。

局限

  • 免费档不能商用:这是最容易踩的坑——免费档或未登录生成的内容发布时必须署名且不得商用;要商用至少需 6 美元/月的 Starter 档。
  • 界面仅英文:截至 2026-09-16,网页与文档均无官方中文界面,上手需要一定英文阅读能力(生成的语音支持中文)。
  • 额度计费需要适应:信用点按月重置、最多结转两个月;不同模型与产品消耗速率不同,长内容需按单次请求上限拆分(v3 为 5,000 字符),重度使用会快速推高档位成本。
  • v3 更"难伺候":官方发布说明提示其需要更多提示词调试且延迟更高;实时场景应改用 Flash v2.5 或 v3 Conversational。
  • 闭源 SaaS:模型不开放权重,只能通过网页与 API 使用,质量、可用性与成本都绑定在单一供应商上。
  • 滥用与合规争议:语音克隆天然伴随伪造风险,平台历史上多次卷入深度伪造事件;克隆他人声音用于商用前,需自行确认授权链条是否完整。

同类参考

与本目录已收录的 Suno 侧重"生成完整歌曲"不同,ElevenLabs 的主线是语音,音乐只是其创意平台的一部分。传统云厂商的 TTS 服务(Amazon Polly、Google Cloud Text-to-Speech、Azure 语音合成)定位更接近基础设施;语音生成赛道内还有 PlayHT、Murf、Speechify 等产品,各自侧重不同场景。

参考资料