现已支持103种语言实时翻译,其中74种语言配备AI语音

2026年5月

Live Translate Live 刚刚完成了一次重大引擎升级。我们将语音识别引擎从Deepgram更换为 ElevenLabs Scribe v2 Realtime,将翻译层从Google Cloud Translation更换为 Google Gemini 2.5,并在Audio模式中新增了由 ElevenLabs v3 驱动的 实时AI语音播放 功能。核心数据:我们现已支持 103种语言 的实时语音识别,其中 74 种语言配备AI语音,并支持 任意两种语言之间的双向 翻译。

如果您曾在我们以47种语言上线时读过旧版支持语言文章,现在的数量已大约翻了一番。该文章已更新以反映新的实际情况;本文则是关于此次变更内容及其在真实对话场景中重要性的公告。

您现在可以做到以前做不到的事

对用户而言,最直观的变化体现在语言选择器上。向下滚动,您会看到条目数量增加了一倍。新加入的语言并不冷僻——它们都是许多用户一直在请求的语言:波斯语、孟加拉语、泰米尔语、泰卢固语、马拉地语、质量更高的印地语、作为独立条目与普通话区分的粤语、缅甸语、高棉语、老挝语、蒙古语、豪萨语、斯瓦希里语、约鲁巴语、祖鲁语、威尔士语、爱尔兰语、希伯来语等更多语言。

第二项变化不那么显眼,但您在对话中会切实感受到:翻译质量明显提升,尤其是在较长或更具细微差别的对话轮次中。Gemini 2.5 能够跨轮次携带 对话上下文,而非逐句孤立翻译。代词能获得正确的先行词。性别一致性在整个对话序列中得以保持。习语会被转化为目标语言中最接近的对应表达,而非逐字翻译。字幕滚动效果更像一位真正的译者,而非一本词典。

第三项变化是全新功能:Audio模式 现在可以用自然的AI语音朗读翻译内容。您说话,点击翻译,手机便以听者的语言朗读翻译后的句子。这一模式适用于出租车、市场摊位、医院候诊室等场景——在这些地方,阅读滚动显示屏并不实际,您自然会将手机来回传递。

语音识别的准确率如何?

ElevenLabs 基于词错误率(WER)基准测试,为Scribe v2发布了四级准确率评级。我们在应用内选择器中以每种语言旁边的彩色圆点来呈现这些等级,并在此处重现了分组情况,方便您快速找到自己的语言。WER越低,意味着识别正确的词语越多。

等级 WER 语言
优秀 ≤ 5% 白俄罗斯语、波斯尼亚语、保加利亚语、加泰罗尼亚语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、加利西亚语、德语、希腊语、匈牙利语、冰岛语、印度尼西亚语、意大利语、日语、卡纳达语、拉脱维亚语、马其顿语、马来语、马拉雅拉姆语、挪威语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、西班牙语、瑞典语、土耳其语、乌克兰语、越南语 (36种)
良好 5–10% 亚美尼亚语、阿塞拜疆语、孟加拉语、粤语、菲律宾语、格鲁吉亚语、古吉拉特语、印地语、哈萨克语、立陶宛语、马耳他语、普通话、马拉地语、尼泊尔语、奥里亚语、波斯语、塞尔维亚语、斯洛文尼亚语、斯瓦希里语、泰米尔语、泰卢固语 (21种)
尚可 10–15% 南非荷兰语、阿拉伯语、阿萨姆语、阿斯图里亚斯语、缅甸语、豪萨语、希伯来语、爪哇语、韩语、柯尔克孜语、卢森堡语、毛利语、奥克西唐语、旁遮普语、塔吉克语、泰语、乌兹别克语、威尔士语 (18种)
发展中 15%+ 阿姆哈拉语、干达语、伊博语、爱尔兰语、高棉语、库尔德语、老挝语、蒙古语、北索托语、普什图语、绍纳语、信德语、索马里语、乌尔都语、沃洛夫语、科萨语、约鲁巴语、祖鲁语 (18种)

WER范围来自ElevenLabs公布的Scribe v2基准测试数据。实际使用中,麦克风位置和环境噪音的影响往往大于前两个等级之间的差距;在安静的房间里使用优质麦克风时,"优秀"等级和"良好"等级的语言在对话中几乎难以区分。

读取该表格的一个实用方法:如果您的语言对位于前两个等级,识别层实际上会"隐形"——您说出的词语会实时显示在屏幕上。如果语言对中有一方属于"尚可"等级,您会在不常见词汇(尤其是专有名词)上偶尔看到替换错误。如果某一方属于"发展中"等级,该语言仍可使用,但转录结果较为粗糙;在这种情况下,Audio模式 可能更为友好,因为您可以在点击翻译前先审阅转录内容。

74种语言的实时AI语音播放

Audio模式是更重要的产品变化。字幕滚动模式始终是两人共用一块屏幕、面对面交流的最佳工具。而Audio模式则适用于其他所有场景——一部手机、一只手、两个需要相互聆听而非阅读的人。

当您点击 立即翻译 时,ElevenLabs v3(或其更快的兄弟版本Flash v2.5,取决于语言)会生成语音翻译,手机随即播放。听起来像真人,而非机器人。您可以随意点击 重播,无需消耗更多积分。如果听者没有听清,只需点击重播即可。

在我们支持的103种语言中,目前有 74 种语言具备AI语音覆盖。不在该范围内的语言在Audio模式中仍可使用——您会在屏幕上看到翻译文本——只是没有语音播放功能。随着ElevenLabs持续更新语音覆盖范围,应用会在启动时自动检查并获取新增语言。

如果您还未尝试过Audio模式,详细介绍请参阅我们的Audio模式文章,完整参考资料请访问 /languages

翻译支持103种语言的任意方向互译

Gemini 2.5 负责翻译层,支持任意语言之间的互译。您可以用日语说话,直接翻译成葡萄牙语,无需经过英语中转。印地语到阿拉伯语。韩语到斯瓦希里语。越南语到波兰语。103种语言共有 10,506个独特语言对,每一对都同时支持双向对话模式。

Gemini 2.5 的独特之处在于对话上下文的处理。旧版翻译引擎将每个句子视为独立字符串处理。这就是为什么有时代词会被翻译成错误的名词,或者语气风格在对话中途突然改变,或者习语被直译成毫无意义的字面内容。Gemini 2.5 能够看到前几轮对话,并在此上下文范围内翻译下一句话。结果感觉不像是逐短语查找,更像是一位从头到尾都在场的真实译者。

哪些语言对体验最佳

全部10,506个语言对均可使用。部分语言对比其他语言对更为流畅。实际使用中,影响特定语言对体验的因素有三个:

我们为何更换引擎

简而言之:我们曾从Deepgram + Google Cloud Translation获得的语言覆盖范围和质量在上线时表现出色,但当我们希望覆盖更多地区时便遇到了瓶颈。Scribe v2以更低的延迟提供更广泛的流式传输覆盖,Gemini 2.5能够跨轮次携带上下文,ElevenLabs v3则解锁了Audio模式所需的语音播放功能。详细版本请参阅另一篇文章,其中包含延迟数据、基准测试结果以及此次切换背后的架构决策。

立即体验

选择您的两种语言,开始实时双语对话。无需下载应用。字幕滚动模式的翻译积分起价为 1美元15分钟;在Audio模式中,转录功能免费,点击翻译后才开始计费。

在字幕滚动模式中开始 · 体验Audio模式 · 完整语言参考 · 查看定价


立即体验 Live Translate Live

立即开始实时双语对话翻译。

免费开始使用