更新日期:2026 年 9 月 10 日|適合關注 Google AI 模型發展、或評估語音辨識技術的開發者與企業

摘要 Google 在 8 月 26 日發布 Gemini 3.5 Transcribe,這是一款專門面向語音轉文字場景的模型,而不是泛用型 Gemini 模型。第三方測試顯示,其轉錄準確度與最終轉錄時間都較 Chirp 3 有明顯進步。這篇整理這款模型實際能做什麼、跟 Chirp 3 相比有哪些差異,以及目前還在公開預覽階段有哪些限制。


目次

  1. Gemini 3.5 Transcribe 是什麼
  2. 兩種使用模式:即時串流 vs 錄音檔處理
  3. 核心能力與準確度數字
  4. 語言支援:不是每種語言都一樣成熟
  5. 目前還是預覽版,有這些限制
  6. 已經整合進哪些產品
  7. 總結
  8. FAQ
  9. 參考文獻

Gemini 3.5 Transcribe 是什麼

Gemini 3.5 Transcribe 是 Google 推出的專門語音轉文字模型,底層運用 Gemini 的音訊理解能力,設計重點是精準、低延遲的語音轉錄,而不是定位成泛用型 Gemini 模型。

官方也直接拿它與既有的 Chirp 3 比較,主打更低的字詞錯誤率與更快的最終轉錄速度,並能直接把原始音訊整理成乾淨、排版過的文字。


兩種使用模式:即時串流 vs 錄音檔處理

這款模型提供兩種不同的操作方式,對應到兩個不同的模型 ID:

即時串流轉錄:使用 gemini-3.5-transcribe-live-preview,串流音訊並即時接收逐步產生的轉錄結果,適合即時字幕、語音輸入等需要低延遲的應用。

錄音檔處理:使用 gemini-3.5-transcribe-preview,用來處理已經錄好的完整音訊,並支援語者分段標記和字詞層級時間戳記。

簡單說,你要的是「邊講邊看到文字」就用即時串流版,你要的是「處理已經錄好的音檔、還要知道是誰在什麼時間點說了什麼」就用錄音檔版,兩者是分開的工具,設計取向不一樣。


核心能力與準確度數字

官方公布的核心能力包括幾項:

智慧轉錄:能處理「我們約禮拜二——不對,禮拜三」這種話講到一半自己修正的情況,自動去除「嗯」「啊」這類贅字,並自動排版文字。

準確度數字:根據 Artificial Analysis 的測量,平均字詞錯誤率(WER)在即時串流模式下是 4.0%,錄音檔處理模式下是 2.6%。在噪音環境和真實世界場景測試中,對郵遞區號、訂單編號這類英數字混合的內容辨識也有不錯表現。

速度:根據 Artificial Analysis 測量,相較 Chirp 3,最終轉錄時間改善 70%。

自訂詞彙:可以辨識特定產業術語、公司自訂的專有名詞或不常見的拼寫,最多支援 1,000 個自訂詞彙,不過官方也提到通常抓 100 個以內最重要的詞彙效果最好,不用把清單塞滿。

語者分段:錄音檔模式最多支援 8 位語者;目前語者分段本身仍標示為實驗功能,其中 3 位以上語者的歸屬辨識也特別標註為實驗階段。


語言支援:不是每種語言都一樣成熟

官方文件列出這款模型能自動偵測並轉錄超過 85 種語言,但這裡有個細節值得注意——官方語言清單裡,每種語言都標註了「支援」或「實驗功能」兩種不同的成熟度等級,不是所有語言都站在同一個水準。

被列為「支援」等級的語言包括:英文(美國、英國、澳洲、印度)、日文、韓文、中文(簡體)、法文、德文、西班牙文(西班牙、美國)、義大利文、葡萄牙文(巴西、葡萄牙)、荷蘭文、丹麥文、瑞典文、波蘭文、俄文、烏克蘭文、土耳其文、越南文、印地文等。

而阿拉伯文、印尼文、泰文、希伯來文、匈牙利文,以及粵語(繁體)等語言,目前都還被歸類在「實驗功能」等級。如果應用場景需要用到「實驗功能」等級的語言,實際使用前仍建議先用自己的音訊測試辨識效果。


目前還是預覽版,有這些限制

這款模型從發布到現在,網路上不少報導直接用「推出」「正式上線」這類字眼形容,但如果照 Google Cloud 官方最新技術文件(更新時間 2026 年 9 月 9 日)逐字對照,Google Cloud 最新技術文件明確將兩個端點的 Launch Readiness 都標示為「Preview」,模型 ID 也帶有 -preview 字尾,這跟正式全面上線(GA)是不同的兩個階段。

除了整體還是預覽版之外,還有幾個實際限制值得知道:

地區僅支援 global:目前兩個模型端點都只能透過「global」這個全球端點存取,單一區域或多區域的支援還沒有上線,文件寫著這部分「即將推出」。

音訊長度有上限:即時串流單次最長 10 分鐘;錄音檔處理若開啟語者分段或時間戳記等功能,處理時間上限是 15 分鐘。

字詞層級時間戳記仍是實驗功能:錄音檔模式支援字詞層級時間戳記,能標出每個字詞出現的精確起訖時間,但官方 API 文件明確提醒,開啟這項功能可能會降低整體轉錄準確度,是一個需要權衡的取捨,不是開了就穩賺不賠。

跨模型協作只在 App 裡,不是 API 能力:Google 在 macOS 版 Gemini App 中,會讓 Gemini 3.5 Transcribe 搭配其他 Gemini 模型在背景處理檔案摘要、圖片生成等工作;但這屬於 Gemini App 的產品整合功能。開發者直接使用 Gemini 3.5 Transcribe 模型時,最新技術文件仍明確列出函式呼叫、系統指令、思考、結構化輸出等能力不支援——這是一款功能非常聚焦、專門做語音轉文字的模型,不是可以拿來做其他任務的泛用模型。

是不是已經到你手上,還要看裝置與國家:Rambler 目前仍有裝置、國家與語言限制。Google Gboard Help 現階段列出的裝置條件是 Pixel 11 系列,至於台灣與繁體中文是否可用,仍應以 Gboard 實際顯示與官方最新支援文件為準。


已經整合進哪些產品

Gemini 3.5 Transcribe 目前已經整合進幾個 Google 產品:

Gboard(Pixel 11 系列):透過新功能「Rambler」,把口語內容轉成排版整齊的文字,並支援用語音下指令編輯、修正錯字、調整寫作風格。

Gemini App(macOS):除了轉錄自然語音成乾淨文字,還能搭配螢幕內容、用語音下指令執行複雜的工作流程,例如摘要本機檔案、生成圖片。

Google AI Studio:開發者可以在 Build 模式下用語音直接生成應用程式雛型(vibe coding)。

Google Antigravity:能結合螢幕內容和對話紀錄,提升檔名、程式碼等內容的轉錄準確度。

即將支援 Chrome:官方預告 Chrome 之後也能直接對任何網頁輸入框口述文字。


總結

Gemini 3.5 Transcribe 這次更新的重點,不是「又一個 Gemini 模型」,而是 Google 罕見地推出一款高度專用、只做語音轉文字這件事的模型。Google 引用的測量結果顯示,相較 Chirp 3,字詞錯誤率與最終轉錄時間都有改善。但目前仍在公開預覽階段,不是正式全面上線,目前可用能力也相當聚焦,不支援函式呼叫這類一般 Gemini 模型常見的能力。

如果正在評估要不要導入語音轉文字相關應用,現階段比較實際的做法是先當成一個值得追蹤、還在成長的選項,而不是直接假設它已經是正式、穩定的產品服務。Gemini 目前底下有不少專門化的模型,Gemini 3.5 Transcribe 是專門處理語音轉文字,另外還有專門處理即時語音對話的 Gemini Live——田中系統的企業電話 AI 服務正是採用 Gemini Live 來處理即時語音互動,這類底層語音技術的發展,也值得持續關注。


FAQ

Q:Gemini 3.5 Transcribe 是正式版還是預覽版?

目前是公開預覽階段,不是正式全面上線(GA)。Google Cloud 官方技術文件明確將兩個模型端點的發布準備完成度標示為「預覽」,模型 ID 本身也帶有 -preview 字尾。部分媒體報導使用「推出」「正式上線」等字眼,但技術文件的正式狀態仍是預覽。

Q:Gemini 3.5 Transcribe 有分國家的正式版跟預覽版嗎?

沒有。官方技術文件顯示這款模型目前僅透過「global」全球端點提供,並非依國家分成不同的發布階段,單一區域或多區域支援目前尚未推出。至於消費端功能(如 Rambler),Google 表示是依特定國家與語言分階段開放,但未公布確切清單。

Q:Gemini 3.5 Transcribe 的準確度如何?

根據 Artificial Analysis 測量,平均字詞錯誤率在即時串流模式下為 4.0%,錄音檔處理模式下為 2.6%;相較 Chirp 3,最終轉錄時間改善 70%。

Q:Gemini 3.5 Transcribe 支援哪些語言?

官方列出支援超過 85 種語言,但成熟度分為「支援」與「實驗功能」兩級。英文、日文、韓文、中文簡體、法文、德文等屬於「支援」等級;阿拉伯文、印尼文、泰文、粵語(繁體)等目前仍屬「實驗功能」,實際使用前建議先用自己的音訊測試辨識效果。

Q:開啟字詞層級時間戳記會影響準確度嗎?

會有影響。Google 官方 API 文件明確提醒,開啟字詞層級時間戳記可能會降低整體轉錄準確度,這是需要依應用場景權衡的功能取捨,不是開了就一定更好。

Q:開發者可以用 Gemini 3.5 Transcribe 呼叫其他 Gemini 模型執行任務嗎?

不行。Google 在 macOS 版 Gemini App 裡會讓這款模型搭配其他 Gemini 模型在背景處理檔案摘要、圖片生成等工作,但這屬於 App 產品整合功能。開發者直接透過 API 呼叫這個轉錄模型時,官方技術文件明確列出不支援函式呼叫、系統指令、思考等一般 Gemini API 常見功能。


參考文獻

  1. Google Blog — Intelligent transcription with Gemini 3.5 Transcribe https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

  2. Google Cloud Documentation — Gemini 3.5 Transcribe(Gemini Enterprise Agent Platform) https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/gemini/3-5-transcribe

  3. Google Gboard Help — Rambler voice input on Gboard https://support.google.com/gboard/answer/17468539

  4. 田中系統 — 企業電話 AI 服務 https://ai-automation.tscloud.com.tw/voice-ai