(注:您提供的原文已经是简体中文。我根据您的要求,对文章进行了润色,使其更加符合“自然流畅、口语化中文”的标准,同时严格保留了产品名和英文原文,并规范了技术术语的用法。)
ElevenLabs 隐藏功能揭秘:你可能不知道的用法
上个月我在搞一个多语言视频项目,需要把一段 15 分钟的中文解说配成英、日、西三种语言。按老习惯,我先把字幕文件翻译好,然后逐句粘到 ElevenLabs 里生成语音。结果光日语那一条,我就耗了快两小时——不仅要调语速,还得手动对齐时间轴,最后导出时才发现有几个词发音根本不对,又得灰溜溜地回去改。
那天晚上我翻 ElevenLabs 的文档,才意识到自己一直把它当个“高级文本转语音工具”在用,完全忽略了里面好多能直接解决我痛点的功能。今天跟你分享几个我后来挖出来的实用功能,都是踩过坑才注意到的。
Dubbing v2:别再手动逐句翻译了
我之前犯的最大的错,就是不知道 ElevenLabs 有专门的 Dubbing(配音)功能。这功能在今年 5 月底更新到了 v2 版本,我试了一下,直接上传原视频和 SRT 字幕文件,选好目标语言,它会自动把翻译、语音生成和时间轴对齐全包了。
实际操作有个细节得注意:上传视频后,它会先提取原音频的时间戳。如果你的 SRT 字幕时间轴本身就不准,生成的配音也会跟着跑偏。我第一次用的时候偷懒,直接用了自动生成的字幕,结果完全对不上。后来我手动校准了一遍 SRT,出来的效果就好多了。
另外,Dubbing v2 会保留原说话人的音色特征进行克隆配音,所以听起来不会是“另一个人在干巴巴地念翻译稿”的感觉。不过对于日语这种语调语言,个别长句的抑扬顿挫还是会有些生硬,我一般会把那几句话挑出来单独重新生成。
情感提示词:Eleven v3 的正确打开方式
很多人知道 ElevenLabs 有不同的模型版本,但不一定注意到 v3(目前还是 alpha 阶段)和之前版本的核心区别:它支持通过提示词来控制语音的情感和表达方式。
以前我想让语音听起来“兴奋一点”,只能选一个本身就偏活泼的音色,然后把语速拉快。现在可以直接在文本里加提示词。比如这样写:
[excited, fast pace] 我们终于做到了!这个功能上线了!
[calm, slower] 接下来我来详细解释一下技术细节。
方括号里的内容不会被读出来,而是作为情感和语速的指令。我试过 [whispering]、[sarcastic]、[serious] 这几个,效果都很明显。但不是所有提示词都管用,我试过 [angry],在某些音色上几乎没啥变化,估计跟音色本身的训练数据有关。建议你先拿短文本测一测,确认效果后再批量跑。
Voice Isolator:录音环境不理想的救星
这个功能藏在工具栏里,不太起眼。它的作用是从一段混有背景噪音的音频里提取出干净的人声。
有次我在外面的咖啡店录了一段旁白,当时觉得环境还行,回来一听全是咖啡机和人声的底噪。本来打算重录,后来想起 ElevenLabs 有这功能,就传上去试了试。处理后的音频大概去掉了 80% 的背景噪音,人声保留得挺完整,只有轻微的“电子感”。
但它不是万能的。如果原音频的信噪比太低,比如在马路边录的,提出来的人声会明显失真。我的经验是,它适合处理“还行但不够干净”的录音,不适合救“完全不能用废片”。
移动端的实际使用体验
ElevenLabs 今年推出了 iOS 和 Android 的原生 App。我一开始觉得这玩意儿有点鸡肋——在手机上打字生成语音,能有什么使用场景?后来有次在地铁上突然想到一段文案的节奏不对,就想改几个词听听效果。打开 App,登录后我的音色和预设都在,改了几句直接导出,发到电脑上替换,全程不到五分钟。
App 每月送 10,000 个字符的免费额度,扣你账户的积分。核心功能是文本转语音,跑的是 Eleven v3 模型。缺点是没有 Dubbing 和 Sound Effects 这些高级功能,所以它更适合用来“快速验证和微调”,不适合做完整项目。
Sound Effects:容易被忽略的音效生成
这功能在文档里归在“Capabilities”下面,我用了大半年才发现。你可以用文字描述来生成音效,比如 rain hitting a tin roof 或者 keyboard typing in a quiet room。生成的音频质量比我想象的好,拿来做视频转场或者铺背景音完全够用。
不过它对英文描述的理解明显比中文好。我试过用中文写“雨滴打在铁皮屋顶上”,生成的效果跟英文描述差了不少。如果你要用这个功能,建议老老实实用英文写提示词。
几个实在的建议
第一,如果你做多语言内容,优先用 Dubbing 而不是手动逐句搞,能省下大把时间。但一定要确保输入的字幕时间轴是准的。
第二,v3 模型的情感提示词值得花时间摸索。建个测试项目,把你常用的音色搭配不同的提示词都跑一遍,记下哪些组合效果好,后面直接复用。
第三,Voice Isolator 的处理是不可逆的,记得保留原文件。我就有过一次处理完觉得不如原版自然,结果原文件已经被删了的惨痛经历。
第四,移动 App 的价值在于“随时随地改几句”,别指望在上面做完整的生产流。
说实话,ElevenLabs 的功能迭代速度挺快的,有时候文档都跟不上产品更新的节奏。我现在的习惯是每隔一两个月去逛一遍文档的“Capabilities”和“Changelog”页面,经常能捡漏。上次我就是这么发现 Sound Effects 的。