更新日期:2026 年 9 月 3 日|適合關注 Google AI 模型發展的開發者與企業用戶

摘要 Google 在 9 月 2 日正式發布 Gemini 3.8 Flash,這是繼 3.6、3.7 Flash 之後,六週內的第三支 Flash 模型。這次同時推出的還有一款專門的資安版本「Gemini 3.8 Flash Cyber」,鎖定漏洞挖掘與自動修補。這篇整理官方公布的完整規格、benchmark 數據、價格,以及先前 WSJ 報導的傳聞裡,哪些說對了、哪些細節官方完全沒有提到。


目次

  1. Gemini 3.8 Flash 正式發布,一次來了兩個版本
  2. 傳聞說對了哪些,官方沒提到的又是什麼
  3. 核心能力:更會想、更會做,尤其是寫程式
  4. Gemini 3.8 Flash Cyber:專門挖漏洞、補漏洞的資安版本
  5. 價格與怎麼取得
  6. 安全性升級
  7. 對比:Gemini 3.5 Pro 呢?
  8. 總結
  9. FAQ
  10. 參考文獻

Gemini 3.8 Flash and 3.8 Flash Cyber 主視覺圖

Gemini 3.8 Flash 正式發布,一次來了兩個版本

Google 在 9 月 2 日正式發布 Gemini 3.8,一次推出兩個變體:Gemini 3.8 Flash,官方稱是目前最聰明的主力工作模型;以及 Gemini 3.8 Flash Cyber,一款專門為資安防禦設計的版本,鎖定漏洞偵測和自動修補。

官方部落格的原話是「延續三週前 3.7 Flash 的動能,這是我們六週內的第三支 Flash 發布」——也就是說,從 3.6 Flash 到 3.7 Flash,再到這次的 3.8 Flash,Google 在過去一個半月裡,維持著平均三週一版的節奏。3.8 Flash 主打推理和程式碼能力的提升,而且速度和成本跟 3.7 Flash 維持在同一個水準,沒有因為能力提升而變貴變慢。

雖然兩個版本是為不同部署情境設計,但官方說法是它們用的是同一套底層智慧,並且透過長時間運作的代理迴圈(agentic loops)持續評估、優化模型本身,這也是這次程式碼和推理能力大幅提升背後的關鍵。


傳聞說對了哪些,官方沒提到的又是什麼

在正式發布之前,《華爾街日報》曾報導 Google 員工在內部平台 Jetski 上測試一款代號「Skimaki」的模型,主打程式碼能力,而且工程師在內部比較測試中偏好這個新版本勝過 Claude Opus。

回頭看官方發布的內容,有幾個地方對上了,也有幾個地方需要修正說法:

說對的部分:三週一版的高頻節奏、主打程式碼與推理能力提升、發布時間落在 9 月初,以及「跟 Claude Opus 比較」這個大方向本身,都跟報導吻合——官方發布內容裡確實有一張完整的 benchmark 比較表,直接列出 Gemini 3.8 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Terra 的對比數字。

沒有被證實的部分:「Skimaki」這個代號沒有出現在任何官方文件裡;至於「贏過 Claude Opus」,官方的比較表呈現的其實是一個更細緻、勝負互見的結果,不是單方面的「贏過」——這部分下一節會詳細說明。

也就是說,當初那則報導在「有沒有新模型要出」「會不會跟 Opus 比較」這兩個大方向上是準的,但「代號」和「全面贏過對手」這種聽起來很乾脆的說法,跟官方實際公布的數據相比,其實過度簡化了。


核心能力:更會想、更會做,尤其是寫程式

Gemini 3.8 Flash 是 Gemini 3 模型家族的最新 Flash 版本,context window 最高支援 100 萬 token,單次輸出上限為 64K token,並支援可自訂的推理力度(effort level),讓開發者依照需求調整品質、成本與延遲。知識截止日期為 2026 年 3 月。

官方公布的 benchmark 顯示,3.8 Flash 比 3.7 Flash 有實質進步,在部分測試上甚至逼近成本更高的前沿模型。

Gemini 3.8 Flash 官方benchmark比較表

DeepSWE v1.1(長時間軟體工程測試)上,3.8 Flash 在自主解決複雜工程問題的端到端表現上,超越了大多數規模更大的前沿模型,而且成本只是那些模型的一小部分。

Gemini 3.8 Flash DeepSWE v1.1測試結果

在需要進階分析和報告能力的專業領域,3.8 Flash 在 Vals Finance Agent V2(金融代理人測試)和 Harvey’s Legal Agent Benchmark(法律代理人測試)上,都超越了 3.7 Flash 和其他前沿模型。在 HLE-Verified 這項橫跨理工、人文、專業領域的多步驟推理測試上,拿到 54.9% 的分數。

官方公布的比較表直接列出 Gemini 3.8 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Terra 等模型的對比數字。不過與其把不同 benchmark 簡化成一個總比分,更有意義的是看幾個具體項目:HLE-Verified 上,3.8 Flash 以 54.9% 些微領先 Opus 5 的 54.4%;Harvey’s Legal Agent Benchmark 上,3.8 Flash 拿到 10.0%,Opus 5 是 6.7%。但反過來,在 Terminal-bench 4.0 上,Opus 5 以 51.8% 大幅領先 3.8 Flash 的 19.1%;OSWorld-2.0 上,Opus 5 同樣以 75.4% 領先 3.8 Flash 的 59.0%。

價格方面差距相當明顯:3.8 Flash 每百萬 token 輸入 0.75 美元、輸出 3.75 美元;Opus 5 是輸入 5 美元、輸出 25 美元,大約貴上 6 到 7 倍。

看這張比較表時,有幾個方法論上的細節值得留意,公平起見要一併說明:官方在 OSWorld-2.0 測試裡,Opus 5 的分數是取自 Anthropic 自己的 Fable 5.1 部落格文章,不是 Google 自行實測的結果;長影片理解測試(LVBench)裡,Gemini 和 GPT-5.6 系列模型看了 1024 幀畫面,但 Claude 系列模型因為 API 限制只看了 300 幀;另外在專業推理測試裡,有一部分題目因為內容政策過濾器擋下了 Sonnet 5、以及少數 Opus 5 的作答,這些都可能讓對手的分數看起來比實際能力更低。這些細節不代表比較表造假,但確實代表這不是一場條件完全對等的測試,看到「贏了幾項」這種簡化說法時,值得多留一個心眼。

這些進步背後的核心設計理念,官方形容是「3.8 Flash 更努力工作」——遇到複雜任務時,它會執行更多推理步驟、反覆呼叫工具,在效果設定較高的情況下,可能會用掉更多 token 來換取更好的表現。如果你的應用場景更在意運算效率,開發者可以選擇較低的效果等級來減少 token 消耗,或是繼續使用 3.7 Flash——官方明確表示 3.7 Flash 仍會完整支援,適合以效率優先的工作負載。


Gemini 3.8 Flash Cyber:專門挖漏洞、補漏洞的資安版本

Gemini 3.8 Flash Cyber 是這次發布的另一個重點,透過新推出的「Fairwind Program」提供給受信任的防禦方使用。Google 表示目前全球已有超過 650 個組織參與這個計畫,成員包括 CrowdStrike、Datadog、Palo Alto Networks、Snowflake 等資安與科技公司,參與組織必須把使用權限限縮在資安、事件應變、滲透測試這類職務的員工,並採用多因素驗證等防護措施。

在業界標準的漏洞挖掘測試 CyberGym 上,3.8 Flash Cyber 拿到 86.2% 的分數,相較前一代 3.5 Flash Cyber 的 77.5% 有明顯進步,也超越了規模大得多的前沿模型。Google 另外用內部基準測試,讓模型在橫跨 20 種程式語言的複雜程式碼庫裡找漏洞,成功率超過 70%。

Gemini 3.8 Flash Cyber CyberGym測試結果

Fairwind Program 的成員可以把 Gemini 3.8 Flash Cyber 搭配 Google 的漏洞修補工具「CodeMender」一起使用,讓找漏洞和修漏洞這兩件事可以在同一套流程裡完成,不需要企業自己另外搭建驗證與修補的機制。

在自動修補漏洞這塊,Google 特別強調投資重點放在「幫防禦方而非攻擊方」——也就是優先做漏洞修補能力,而不是進攻性的漏洞利用能力。在外部測試 CWE-Bench 上,3.8 Flash Cyber 的 pass@1 達到 47.2%,跟目前最強的前沿模型(47.8%)幾乎打平,但成本低很多。

官方也公布了幾個已經在 Google 內部實際應用的成果:Chrome 資安團隊發現,3.8 Flash Cyber 針對 Chrome 漏洞產出的正確修補方案,數量是市面上最強商用模型的 2.6 倍;資安公司 Wiz 在自己的滲透測試基準上,發現 3.8 Flash Cyber 的召回率比其他頂尖前沿模型高出 7.5% 到 9.7%,成本卻低了 2.3 到 5.2 倍;Google 雲端漏洞研究團隊用這個模型,在不到兩小時內就找到一個通常要花上好幾個月才能發現的關鍵基礎漏洞。


價格與怎麼取得

3.8 Flash 的定價跟 3.7 Flash 完全一樣,維持在介紹價:每百萬輸入 token 0.75 美元、輸出 3.75 美元。這個介紹價會到 2026 年 12 月 31 日為止,2027 年 1 月 1 日起調整為輸入 1.50 美元、輸出 7.50 美元。

取得管道依身份不同:

開發者:可以在 Google Antigravity 裡體驗代理優先的工作流程,或透過 Google AI Studio、Android Studio 的 Gemini API 開始建置,也能在 Stitch 裡用來生成介面。

企業用戶:透過 Gemini Enterprise 存取。

一般消費者:Google AI Pro 和 Ultra 訂閱者可以在 Gemini App、Google 搜尋的 AI 模式,以及 Google 試算表裡使用。

資安用戶:Gemini 3.8 Flash Cyber 透過新的 Fairwind Program 提供,優先開放給受信任的政府單位、關鍵基礎設施營運商,以及軟體維護團隊,需要另外申請存取權限。


安全性升級

Google 也針對 Gemini 3.8 Flash 進行了前沿安全框架(Frontier Safety Framework)評估。根據 Model Card 揭露的資訊,Google 依循今年 4 月版的框架標準評估後,認為 3.8 Flash 沒有達到需要額外管控的 Tracked 或 Critical Capability Levels,安全性評估延續了 3.7 Flash 的既有結論。3.8 Flash 依然針對化學、生物、輻射、核能(CBRN)以及網路攻擊這幾個領域,內建了防範濫用的防護機制。

3.8 Flash Cyber 因為設計用途是給經過審核的資安研究和防禦人員使用,防護機制的設計邏輯跟一般版本不同——它放寬了部分網路安全相關的限制,讓合法的資安研究和滲透測試工作能順利進行,這也是為什麼它沒有公開給一般 API 或消費性產品使用,只透過 Fairwind Program 提供給審核通過的信任夥伴。

另外值得一提的是,Gemini 3.8 系列在提示詞注入(prompt injection)的防禦能力上有顯著提升,根據 Gray Swan 的測試結果,能更有效保護使用者不受提示詞注入類型的惡意攻擊影響。

Gemini 3.8 Flash Gray Swan提示詞注入防禦測試結果


對比:Gemini 3.5 Pro 呢?

Flash 系列這邊動作頻頻,原本預計今年 6 月推出的 Gemini 3.5 Pro 至今仍沒有正式發布。Sundar Pichai 在 5 月 I/O 曾預告這款模型,但到了 3.8 Flash 上線,Google 仍未公布 3.5 Pro 的正式推出時間。

先前有報導指出,Google 內部候選 Pro 模型可能因開發調整而延誤,市場也開始猜測 Google 是否會直接把重心移往 Gemini 4。不過 Google 目前沒有正式宣布取消 3.5 Pro,因此這部分仍只能視為外界推測。


總結

Gemini 3.8 Flash 這次發布證實了先前傳聞的大方向——確實有新模型、確實主打程式碼能力、確實會拿來跟 Claude Opus 5 比較,而且維持著三週一版的高頻節奏。不過「贏過 Opus」這種說法,跟官方實際公布的比較表相比是過度簡化的:3.8 Flash 在部分任務領先、Opus 5 在自主操作與電腦使用這類任務上依然大幅領先,價格差距則是 3.8 Flash 最大的優勢之一。這提醒我們,發布前流出的片段消息,往往會把複雜的結果簡化成一句好懂的口號,實際數字通常更值得多看一眼。

比模型本身更值得留意的,或許是這次同時推出的 Gemini 3.8 Flash Cyber——Google 把資安防禦能力做成一個獨立模型、搭配一個需要申請的信任計畫,這代表 Google 在企業資安這塊,正在往更深、更專門的方向投入,而不只是把泛用模型拿來套用在資安場景上。

至於 Gemini 3.5 Pro,答案還是要繼續等下去。


FAQ

Q:Gemini 3.8 Flash 是什麼時候發布的?

Google 在 2026 年 9 月 2 日正式發布 Gemini 3.8 Flash,這是繼 3.6 Flash、3.7 Flash 之後,六週內的第三支 Flash 模型發布。

Q:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 有什麼不同?

Gemini 3.8 Flash 是一般用途的主力模型,主打程式碼與推理能力;Gemini 3.8 Flash Cyber 是專門為資安防禦設計的版本,鎖定漏洞偵測和自動修補,透過 Fairwind Program 提供給受信任的防禦方使用,防護機制設定也不同於一般版本。

Q:Gemini 3.8 Flash 真的贏過 Claude Opus 5 嗎?

不能簡化成全面勝出或落敗。Google 公布的比較數據顯示,3.8 Flash 在 HLE-Verified、Harvey’s Legal Agent Benchmark 等測試上領先 Opus 5,但 Opus 5 在 Terminal-bench 4.0、OSWorld-2.0 這類長時間自主操作與電腦使用任務上大幅領先。3.8 Flash 最明顯的優勢是價格,大約只有 Opus 5 的六到七分之一。

Q:Gemini 3.8 Flash 價格是多少?

與 3.7 Flash 相同,介紹價為每百萬輸入 token 0.75 美元、輸出 3.75 美元,優惠到 2026 年 12 月 31 日。2027 年 1 月 1 日起調整為輸入 1.50 美元、輸出 7.50 美元。

Q:一般用戶要怎麼使用 Gemini 3.8 Flash?

Google AI Pro 和 Ultra 訂閱者可以在 Gemini App、Google 搜尋的 AI 模式,以及 Google 試算表裡使用。開發者可透過 Google AI Studio、Android Studio 或 Google Antigravity 使用;企業用戶則透過 Gemini Enterprise 存取。

Q:Gemini 3.8 Flash 的技術規格是什麼?

Gemini 3.8 Flash 延續 3.7 Flash 的架構,context window 最高支援 100 萬 token,單次輸出上限 64K token,支援可自訂的推理力度來平衡品質、成本與延遲,知識截止日期為 2026 年 3 月。

Q:Gemini 3.8 Flash Cyber 需要哪些條件才能申請?

需透過 Fairwind Program 申請,目前全球已有超過 650 個組織參與,包括政府單位、關鍵基礎設施營運商與資安公司。參與組織必須把使用權限限縮在資安、事件應變、滲透測試等職務的員工,並採用多因素驗證等防護措施。

Q:Gemini 3.5 Pro 現在是什麼狀況?

Gemini 3.5 Pro 原訂 2026 年六月推出,至今仍未正式發布,Google 官方也未針對其狀態發布任何新的公開說明。市場上有猜測 Google 可能會跳過這一代,直接將資源投入下一代 Gemini 4。


參考文獻

  1. Google Blog — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

  2. Google DeepMind — Gemini 3.8 Flash Model Card https://deepmind.google/models/model-cards/gemini-3-8-flash/

  3. Google DeepMind — Fairwind Program https://deepmind.google/fairwind-program/

  4. Google Blog — Google’s Fairwind Program: Cyber defense tools for trusted partners https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/

  5. Google AI for Developers — Gemini API latest models https://ai.google.dev/gemini-api/docs/latest-model

  6. The Wall Street Journal — New Google AI Model Said to Narrow Gap on Coding Ability https://www.wsj.com/tech/ai/new-google-ai-model-said-to-narrow-gap-on-coding-ability-264c6052