Google 在 2026 年 9 月 2 日發表 Gemini 3.8 Flash,這是六週內第三款 Flash 模型。正式版模型 ID 是 gemini-3.8-flash,已在 Gemini app、Google AI Studio、Gemini API、Android Studio、Antigravity 與 Gemini Enterprise 等產品上架。

這次主要變化是長時間 coding 與 Agent。DeepSWE v1.1 從 3.7 Flash 的 65.3% 提高到 73.7%,不過每百萬 token 的 Standard API 牌價沒有變。Google 也直接提醒,3.8 遇到複雜任務時會增加推理、工具呼叫與驗證步驟,所以「同價升級」不代表完成每項任務的帳單相同。

Gemini Flash 是什麼

Gemini 是 Google DeepMind 開發的 AI 模型家族,能理解文字、圖片、音訊、影片與 PDF,也能呼叫搜尋、程式執行和其他工具。Flash 是其中偏向低延遲、高吞吐量與較低 API 成本的系列,用來在旗艦模型品質和大量請求的速度、價格之間取得平衡。

Gemini 3.8 Flash 延續這個定位,主要改善程式開發、專業知識工作與多步驟 Agent。它不是只有 Gemini 聊天介面裡的一種模式,而是有獨立模型 ID 的正式版模型;開發者可以把它放進自建應用、coding agent 或企業工作流程。

3.8 Flash 與 3.8 Flash Cyber 的差別

Google 同日公布的 Gemini 3.8 Flash Cyber 使用相同基礎智慧,但針對資安任務調整安全邊界。它目前只透過 Fairwind Program 提供給通過審核的政府、關鍵基礎設施營運者與軟體維護者,不是一般 Gemini app 或公開 API 裡可以選擇的模型。



Sponsored Links

Gemini 3.8 Flash 規格與發布狀態

項目Gemini 3.8 FlashGemini 3.7 Flash
API 狀態GA,可用於正式服務GA,尚未停用
模型 IDgemini-3.8-flashgemini-3.7-flash
輸入文字、圖片、影片、音訊、PDF文字、圖片、影片、音訊、PDF
輸出文字文字
Context window1,048,576 tokens1,048,576 tokens
最大輸出65,536 tokens65,536 tokens
Thinking levellow/medium/high,預設 mediumlow/medium/high,預設 medium
Knowledge cutoff2026 年 3 月,部分領域較早2026 年 3 月,部分領域較早

支援的工具包括 context caching、code execution、file search、function calling、Google Maps/Search grounding、structured outputs、URL context,以及預覽中的 computer use。它不能直接生成圖片或音訊,也不支援 Live API;要產圖仍需改用 Gemini Image 系列。

minimal 也不是 3.8 Flash 可用的 thinking level,送出後會回傳錯誤。一般 API 請求如果沒有設定,會使用 medium

六週三次頻繁更新Flash

Gemini 3.6 Flash 在 7 月 21 日發布,3.7 在 8 月 13 日接著上線,3.8 又在 9 月 2 日推出。前兩次相隔 23 天,後兩次相隔 20 天;Google 因此把 3.8 稱為六週內第三款 Flash。

Gemini 3.6 Flash、3.7 Flash 與 3.8 Flash 在六週內依序發布的時間線,分別是 2026 年 7 月 21 日、8 月 13 日與 9 月 2 日
短週期更新不等於每一版都完成全新的大型預訓練。

版本號跳得快,不能直接解讀成 Google 每三週重訓一次大型 foundation model。3.8 模型卡明確寫它是「based on Gemini 3.7 Flash」,官方沒有公開參數量、資料量或完整訓練流程。較合理的說法是 Google 在 3.7 基礎上持續改良,但無法再推論哪些進步來自 supplemental training、後訓練、工具流程或其他方法。

3.5 Pro 與 Gemini 4 沒有同步發布

3.7 發布時,另一個問題是「為什麼一直更新 Flash,3.5 Pro 和 Gemini 4 呢?」這次公告仍沒有發布 3.5 Pro,也沒有給出 Gemini 4 上線時間。最近可確認的官方進度仍是 Alphabet 2026 年第二季說明:3.5 Pro 正在測試,Gemini 4 已開始預訓練。3.8 Flash 的出現沒有改變這兩項狀態。

長時間 coding 與 Agent 提升多少

Google 的模型卡顯示,3.8 對 3.7 的提升集中在長時間軟體工程、終端機操作與電腦操作。DeepSWE v1.1 增加 8.4 個百分點,Terminal-bench 4.0 增加 7.9 個百分點,OSWorld-2.0 增加 8.4 個百分點;一般知識推理的 HLE-Verified 則只增加 1.3 個百分點。

Gemini 3.8 Flash 與 3.7 Flash 的四項官方 benchmark 比較,3.8 在 DeepSWE、Terminal-bench 4.0、OSWorld-2.0 與 HLE-Verified 都取得較高分數
3.8 的增幅集中在 coding 與多步驟操作。
官方評測3.8 Flash3.7 Flash變化
DeepSWE v1.173.7%65.3%+8.4
Terminal-bench 2.189.4%85.8%+3.6
Terminal-bench 4.019.1%11.2%+7.9
OSWorld-2.059.0%50.6%+8.4
GDPVal-AA v215451482+63
Vals Finance Agent v261.4%59.0%+2.4
Harvey’s Legal Agent10.0%8.8%+1.2
HLE-Verified54.9%53.6%+1.3

這些分數來自 Google 模型卡列出的測試設定,不是使用任何 coding agent 都會得到相同成功率。模型、agent harness、thinking level、工具權限與題目版本都會影響結果;3.8 公告也沒有更新 3.7 舊文使用的 FrontierCode、WebDev Arena 與 AutomationBench,不能假設那些項目也依同樣比例提升。

3.7 的 DeepSWE 落後問題大致補上

3.7 Flash 發表時,DeepSWE 65.3% 低於 GPT-5.6 Terra 的 69.6%,也略低於當時約 67% 的 Luna,因此長時間 repository coding 是它相對同業的弱項。3.8 提高到 73.7%,已高於 GPT-5.6 Sol 的 72.7% 與 Terra 的 69.6%,距 Claude Opus 5 的 74.0% 只差 0.3 個百分點。

Gemini 3.8 Flash、3.7 Flash、Claude Opus 5、GPT-5.6 Sol 與 Terra 的 DeepSWE v1.1 分數及 Standard API 每百萬 token 價格比較
跨公司比較成本時,仍要計入 token 用量與工具設定。

圖中的 GPT-5.6 Sol $4/$20 是至少到 2026 年 11 月 21 日的促銷價。Sol 與 Terra 的單次輸入超過 272K tokens 時,整個請求會改按 input 2 倍、output 1.5 倍計價,不是只有超出部分加價。

這仍不是「全面超越」。Terminal-bench 4.0 的 19.1% 低於 Opus 5 的 51.8%、Sol 的 37.3% 與 Terra 的 23.6%;OSWorld-2.0 的 59.0% 也低於 Opus 5 的 75.4% 和 Sol 的 62.6%。3.8 比較像是補上前代的長時間 coding 缺口,而不是在每一種終端機與電腦操作任務都排第一。

單價相同,任務成本可能更高

3.8 與 3.7 Flash 的 Standard API 單價相同。2026 年 12 月 31 日以前,每百萬輸入/輸出 token 是 0.75/3.75 美元;2027 年 1 月 1 日起恢復為 1.50/7.50 美元。這仍是限時價格,不是永久定價。

服務層級2026 年底前 Input2026 年底前 Output2027 年起 Input/Output
Standard paid$0.75$3.75$1.50/$7.50
Batch/Flex$0.375$1.875$0.75/$3.75
Priority$1.35$6.75$2.70/$13.50
Standard context cache$0.075;儲存 $0.50/百萬 tokens/小時$0.15;儲存 $1.00/百萬 tokens/小時

Google 說明 3.8 在複雜任務會進行更多 reasoning steps、反覆呼叫工具並驗證結果,尤其 high thinking 更明顯。Output 計價包含 thinking tokens,因此同一個提示即使最後答案一樣長,也可能因內部推理與工具工作增加而變貴。正確比較方式不是只看牌價,而是記錄完成率、重試次數、延遲及每項成功任務使用的總 token。

Interactions API 的 usage 資料可分別查看 total_input_tokenstotal_output_tokenstotal_thought_tokenstotal_cached_tokenstotal_tool_use_tokenstotal_tokens。升級前後各跑一小批代表性工作,就能看出品質提升是否抵消額外推理成本。

Gemini 3.8 Flash 的官方使用建議與提示詞範本

Google 沒有另外發布一份只屬於 3.8 Flash 的提示詞文件,但 3.8 模型頁直接連到 Gemini 3 提示策略。官方重點是直接、清楚與結構一致:把角色、限制和輸出格式放在 system instruction 或提示開頭,不要以過度冗長的背景讓模型先猜任務。

Gemini 3.8 Flash 的 low、medium 與 high thinking level 選擇指南,分別適合日常工作、複雜 coding Agent 與高難度多步驟決策
先用任務難度選 thinking,不要把 high 當成固定預設。

日常問答、分類、草稿與即時分析可先用 low;coding、研究和多工具 Agent 使用預設的 medium;只有高難度推理、多步驟決策或 medium 無法穩定完成時再用 high。如果核心要求是最低延遲與 token,Google 反而建議保留 3.7 Flash。

時效問題的日期與搜尋設定

3.8 Flash 的 knowledge cutoff 標為 2026 年 3 月,而且部分領域可能只到 2025 年 1 月。Google 建議在需要最新資料的工作中,把目前日期放進 system instruction,並啟用 Google Search grounding。以下是依官方格式改寫、可放在 Google AI Studio「System Instructions」或 API system_instruction 的繁中版本:

目前日期是 {{YYYY 年 MM 月 DD 日}}。處理新聞、價格、版本、人物職稱或其他可能變動的資訊時,先使用 Google Search 查證,再回答。清楚區分搜尋取得的現況、模型既有知識與你的推論;找不到官方資料時直接說明。

長文件的資料與任務順序

長 context 不代表把問題埋在文件中間也能得到同樣穩定的結果。官方建議先放完整資料,再在最後提出具體任務,並明寫「根據上述資料」。以下範本依官方建議改寫,可放在 AI Studio 對話框、API user message 或 Agent 的任務描述:

<資料>
{{貼上文件、程式碼、紀錄或會議內容}}
</資料>

根據上述資料完成以下任務:
1. 列出三個最重要的結論。
2. 每個結論附上資料中的直接依據。
3. 資料沒有提供的內容標記為「資訊不足」,不要自行補完。

輸出格式:先給 100 字摘要,再用表格列出結論、證據與不確定性。

Agent 的規劃、執行、驗收與進度規則

Google 對 Agent 工作的建議可整理成 Plan → Execute → Validate → Format。除了交代目標,也要寫清楚可以讀寫什麼、哪些動作要先確認、失敗時何時停止,以及長任務如何回報進度。以下範本依官方建議改寫,適合放進 Antigravity 專案指令、coding agent 規則或 API 的 system instruction:

先讀取需求與現有檔案,提出最小可行計畫,再開始修改。

執行規則:
- 只修改與任務直接相關的檔案,不擴大範圍。
- 可執行唯讀檢查與既有測試;安裝套件、刪除資料或對外發布前先取得確認。
- 長時間工作開始前說明下一步,期間簡短回報已完成事項與發現。
- 遇到同一錯誤兩次後停止,整理錯誤與可行替代方案。

驗收:完成後重新執行直接相關的測試,逐項核對需求。最後回覆修改內容、驗證結果、未解風險與檔案清單。

只依資料回答時的停止條件

合約、政策、研究或內部文件最怕模型把常識混進來源。官方 grounded assistant 方法是限制答案只能使用提供的資料,缺少依據就明說無法回答。以下範本依官方方法改寫,可放在 system instruction,再把文件當成 user message:

你是依資料回答的助理。只能使用使用者提供的內容,不可加入外部知識、常識推測或未標示的假設。每個重要結論都要指出依據;若資料沒有直接支持答案,請回覆「根據目前提供的資料無法判定」,並列出還需要哪些資訊。

從哪裡使用 Gemini 3.8 Flash

入口使用方式適合對象
Gemini appGoogle AI Pro/Ultra 可使用 3.8 Flash一般問答、研究與檔案工作
Google AI ModeGoogle AI Pro/Ultra 可使用搜尋與複雜問題
Google SheetsPro/Ultra 方案內使用試算表分析與整理
Google AI Studio選擇 gemini-3.8-flash測試提示詞與 API
Gemini API在 request 指定模型 ID自建應用與 Agent
Android Studio開發工具內使用Android 開發者
Google Antigravitycoding agent 內選用程式開發與網站工作
Gemini Enterprise企業平台內使用公司資料與工作流程

Gemini API 有免費層,但額度與速率限制較低,而且免費服務的內容可用於改善 Google 產品;付費層內容不會用於改善產品。Gemini app、AI Mode 與 Sheets 的 3.8 Flash 入口提供給 Google AI Pro/Ultra 訂閱者,不能把 API 已 GA 解讀成每個免費 Gemini 帳號都會出現模型選單。

3.7 Flash 需要立刻升級嗎

不需要。3.7 Flash 仍是 GA,官方棄用清單沒有列出關閉日期;Google 也明確表示,效率優先的工作可以繼續使用 3.7。3.8 的主要理由是提高複雜任務成功率,而不是強制所有流量換版。

工作類型建議原因
分類、摘要、短文改寫先保留 3.7/low延遲與 token 比額外推理重要
一般 coding 與工具流程測試 3.8/medium預設設定,品質與成本較平衡
長時間 repository 修改優先評估 3.8/mediumDeepSWE 改善幅度較大
高難度多步驟決策再測 3.8/high可能提高完成率,也會增加延遲與 token
正式大量流量先做小比例 A/B觀察成功任務成本與 timeout,不只看牌價

評估時應固定相同提示詞、工具、資料、重試規則與驗收方式,再比較完成率、總 token、p95 延遲和錯誤率。若 3.7 已能一次完成任務,3.8 多出的思考不一定有價值;若工作常因計畫、工具選擇或驗證不足而失敗,3.8 才可能用較高單次成本換到較低重試成本。

API 遷移檢查清單

從 3.7 升到 3.8,第一步是把模型 ID 改成 gemini-3.8-flash,再重跑自己的評測。規格相近不代表行為完全相同,尤其要檢查 thinking token、工具呼叫次數、timeout 與輸出格式。

  • Thinking:使用 lowmediumhigh;不要送出不支援的 minimal
  • 取樣參數:從較舊 Gemini 遷移時移除 temperaturetop_ptop_kcandidate_count,避免覆蓋模型最佳預設。
  • Thinking 設定:把舊的 thinking_budget 改為 thinking_level
  • 多輪對話:使用 Interactions API 的 previous_interaction_id,不要預先填入模型回覆。
  • GenerateContent function calling:保留 call_id 與函式名稱,確認工具結果能對應原呼叫。
  • Thought signature:使用 Gemini 3 的 function calling 時保留模型回傳的 thought signature,不要自行合成或刪除。
  • 成本觀察:分開記錄 input、output、thought、cached 與 tool-use tokens,並設定可接受的 timeout 和重試上限。

正式流量建議先切一小部分到 3.8,確認結構化輸出 schema、函式呼叫與長 context 都正常,再逐步提高比例。只換模型 ID 後看到 HTTP 200,不代表回覆品質、成本和 agent 行為都已通過遷移。

Gemini 3.8 Flash 的使用限制

3.8 Flash 仍會產生不正確資訊,也可能在高 effort 或長工具鏈中變慢、timeout 或使用比預期更多的 token。需要最新資料時應啟用 Search grounding;需要關鍵事實、法律、財務或醫療判斷時,仍要回到原始資料與專業審核。

模型卡的自動化安全評測中,Multilingual Safety 相較 3.7 增加 5.4 個百分點、Unjustified-refusals 增加 1.1 個百分點,而這兩項都是越低越好。Google 表示人工檢查後,多數差異屬於 false positive 或非嚴重案例。這是安全測試的退步訊號,不等於繁體中文整體品質下降 5.4%,但部署多語言客服或內容審核時仍值得把誤拒答納入測試。

最後,3.8 Flash 只能輸出文字。它雖然能理解圖片、音訊與影片,但不能直接產生這些媒體;也不支援需要即時語音串流的 Live API。多模態「理解」與多模態「生成」是兩件不同的事。

常見問答

Gemini 3.8 Flash 是正式版嗎?

是。gemini-3.8-flash 是 GA 模型,可用於正式服務,不是 Preview 模型。

Gemini 3.8 Flash 可以免費用嗎?

Gemini API 有免費層,但速率與額度限制較低,內容可用於改善 Google 產品。Gemini app 的 3.8 Flash 入口提供給 Google AI Pro/Ultra 訂閱者。

Gemini 3.8 Flash 能生成圖片嗎?

不能。它可以理解圖片並輸出文字,但 image generation 不在支援功能內;產圖要改用 Gemini Image 系列。

3.7 Flash 已經要停用了嗎?

沒有。3.7 Flash 仍是 GA,官方棄用清單目前沒有關閉日期,而且 Google 建議效率優先的工作可以繼續使用。

一般使用者可以選 3.8 Flash Cyber 嗎?

目前不行。Cyber 版本只透過 Fairwind Program 提供給通過審核的資安防禦機構,不是公開 API 或一般 Gemini app 模型。

參考來源


Sponsored Links

發佈留言