我們為何將 Deepgram + Google Translate 換成 ElevenLabs Scribe v2 + Gemini 2.5
2026 年 5 月
這篇文章是103 語言上線公告的幕後補充。如果那篇是「這是我們改變了什麼」,這篇則是「這是我們為何選擇這些供應商」。核心成果:語言覆蓋範圍大約翻倍、語音辨識延遲更低、具對話脈絡的翻譯,以及支援 74 種語言的即時 AI 語音播放。
我們為何更換供應商
舊架構使用 Deepgram 進行語音辨識,並以 Google Cloud Translation 作為翻譯層。上線時表現穩定,但瓶頸在於語言覆蓋範圍。Deepgram 的串流模型在生產品質下大約支援 40–50 種語言,而語言清單的擴充速度不夠快,無法滿足使用者對孟加拉語、泰米爾語、泰盧固語、馬拉地語、粵語(有別於普通話的獨立項目)、緬甸語、高棉語、威爾斯語、希伯來語等語言的需求。
第二個壓力來自輸出端。我們希望推出 Audio mode——以輪流對話方式進行翻譯,並以聆聽者的語言朗讀結果。這意味著需要加入舊架構所沒有的 TTS 層。一旦要為管線的某個環節引入新供應商,就值得思考是否乾脆整合在一起。
為何選擇 Scribe v2 進行語音辨識
ElevenLabs 於 2026 年 1 月發布了 Scribe v2 Realtime。ElevenLabs 公布的主要數據為:串流延遲約 150 毫秒、在 FLEURS 基準測試中多語言詞錯率為 5.8%,以及在與業界標準 ASR 模型的比較中,30 個基準語言的整體準確率達 93.5%。支援語言清單約有 100 種,並附有公開的四級準確度分級,涵蓋「優秀」(詞錯率 ≤5%)、「高」(5–10%)、「良好」(10–15%)及「發展中」(15%+)。
我們針對已運行的語言,自行與 Deepgram 進行了比較測試。延遲數據確實成立——轉錄文字幾乎與說話者的聲音同步出現,快到讓人感知到的瓶頸轉移至翻譯步驟。在我們原本已支援的語言上,正面比較的轉錄品質相當或更佳,最大的進步出現在原本表現較弱的語言:印地語從「能用但粗糙」提升至「運作流暢」,孟加拉語和泰米爾語則從「未上線生產」進入「以高級別上線生產」。
我們還喜歡的另一點是:Scribe 內建原生的逐段語言識別功能,大幅簡化了我們的雙說話者處理邏輯,也意味著我們可以擴充語言清單,而無需為每次新增語言累積額外的整合工作。
為何選擇 Gemini 2.5 進行翻譯
無狀態的逐句機器翻譯有一組已知的失敗模式:代名詞在缺乏先行詞的情況下被翻譯、有性別區分的語言在對話中途出現漂移、語氣正式程度突然改變,以及慣用語被直譯成毫無意義的文字。這些問題都有一個共同根源:翻譯器只看得到當前這個句子。
Gemini 2.5 能在對話輪次之間保留對話脈絡。模型在翻譯下一段話語時,能看到對話的近期歷史,這在無需我們額外加裝任何特殊機制的情況下,修正了大多數漂移問題。實際使用上,翻譯結果感覺不像是查字典,更像是一位從頭到尾都在場的人所做的翻譯。代價是每次呼叫的延遲略高於舊的無狀態機器翻譯——是低數百毫秒而非數十毫秒——但從「說話者停止說話」到「聆聽者看到翻譯」的端對端時間,在我們測量過的語言上仍遠低於一秒。
我們選擇 Gemini 的另一個原因是:翻譯端的語言覆蓋範圍不再是限制因素。Gemini 2.5 涵蓋 Scribe 所能辨識的所有語言,且支援任意方向互譯,這正是「任意對任意 10,506 個語言對」的說法成真而非只是願景的原因。
為何選擇 ElevenLabs v3 作為 Audio mode 的 TTS
Audio mode 引入了一個新的管線階段:將翻譯後的文字轉換為聆聽者語言的語音。我們選擇 ElevenLabs v3,原因在於其語言覆蓋範圍(目前約 74 種語言)與語音品質。這些聲音聽起來像真人,而非聽寫軟體,多語言支援也意味著同一個產品介面可在我們支援語言清單的整個上半部運作。對於支援 ElevenLabs Flash v2.5 的語言,我們優先採用:它更快、更便宜,且品質接近到難以在並排比較中分辨差異。
支援即時語音播放的語言清單會隨著 ElevenLabs 推出覆蓋範圍更新而持續增加;當新語言上線後,應用程式會自動取得。
使用者會注意到什麼
- 語言選擇器中有更多語言。 共 103 個項目,大約是先前清單的兩倍,涵蓋大多數最常被要求新增的語言。
- 翻譯感覺更自然。 代名詞正確解析、語氣正式程度在輪次間保持一致、慣用語得到合理的詮釋。這是對話脈絡效果的體現。
- Audio mode 會朗讀翻譯結果。 目前 74 種語言支援 AI 語音;其餘語言在 Audio mode 中仍可使用,但僅輸出文字。
- 語言選擇器中的等級圓點。 每種語言旁邊的小彩色圓點代表預期的語音辨識準確度——綠色為優秀、黃色為高、橙色為良好、紅色為發展中——依據 ElevenLabs 公布的詞錯率基準測試結果。
- 雙向對話仍然感覺是雙向的。 雙方同時獲得翻譯,無需輪流等待,也沒有尷尬的停頓。
數據
- 語言數(STT):103 種,從 47 種增加
- 語言數(即時 TTS):74 種
- 語言對(翻譯):10,506 對(從 2,162 對增加)
- Scribe v2 串流延遲:約 150 毫秒(ElevenLabs 公布數據)
- FLEURS 多語言詞錯率:5.8%(ElevenLabs 公布數據)
- 計費方式:按字元計費,平均分攤於轉錄、翻譯與 TTS——每個處理字元消耗一點積分;在 Audio mode 中,點擊翻譯前的轉錄為免費
如果您想看使用者版本
上線公告文章從使用者角度介紹了相同的變更——語言選擇器的新功能、各準確度等級的預期表現,以及 Audio mode 的實際使用感受。完整的語言參考清單位於 /languages。如果您想親自試用,marquee 在這裡,Audio mode 在這裡。