Google 在 2026 年 9 月 2 日發表 Gemini 3.8 Flash,這是六週內第三款 Flash 模型。正式版模型 ID 是 gemini-3.8-flash,已在 Gemini app、Google AI Studio、Gemini API、Android Studio、Antigravity 與 Gemini Enterprise 等產品上架。
這次主要變化是長時間 coding 與 Agent。DeepSWE v1.1 從 3.7 Flash 的 65.3% 提高到 73.7%,不過每百萬 token 的 Standard API 牌價沒有變。Google 也直接提醒,3.8 遇到複雜任務時會增加推理、工具呼叫與驗證步驟,所以「同價升級」不代表完成每項任務的帳單相同。
Gemini Flash 是什麼
Gemini 是 Google DeepMind 開發的 AI 模型家族,能理解文字、圖片、音訊、影片與 PDF,也能呼叫搜尋、程式執行和其他工具。Flash 是其中偏向低延遲、高吞吐量與較低 API 成本的系列,用來在旗艦模型品質和大量請求的速度、價格之間取得平衡。
Gemini 3.8 Flash 延續這個定位,主要改善程式開發、專業知識工作與多步驟 Agent。它不是只有 Gemini 聊天介面裡的一種模式,而是有獨立模型 ID 的正式版模型;開發者可以把它放進自建應用、coding agent 或企業工作流程。
3.8 Flash 與 3.8 Flash Cyber 的差別
Google 同日公布的 Gemini 3.8 Flash Cyber 使用相同基礎智慧,但針對資安任務調整安全邊界。它目前只透過 Fairwind Program 提供給通過審核的政府、關鍵基礎設施營運者與軟體維護者,不是一般 Gemini app 或公開 API 裡可以選擇的模型。
Gemini 3.8 Flash 規格與發布狀態
| 項目 | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| API 狀態 | GA,可用於正式服務 | GA,尚未停用 |
| 模型 ID | gemini-3.8-flash | gemini-3.7-flash |
| 輸入 | 文字、圖片、影片、音訊、PDF | 文字、圖片、影片、音訊、PDF |
| 輸出 | 文字 | 文字 |
| Context window | 1,048,576 tokens | 1,048,576 tokens |
| 最大輸出 | 65,536 tokens | 65,536 tokens |
| Thinking level | low/medium/high,預設 medium | low/medium/high,預設 medium |
| Knowledge cutoff | 2026 年 3 月,部分領域較早 | 2026 年 3 月,部分領域較早 |
支援的工具包括 context caching、code execution、file search、function calling、Google Maps/Search grounding、structured outputs、URL context,以及預覽中的 computer use。它不能直接生成圖片或音訊,也不支援 Live API;要產圖仍需改用 Gemini Image 系列。
minimal 也不是 3.8 Flash 可用的 thinking level,送出後會回傳錯誤。一般 API 請求如果沒有設定,會使用 medium。
六週三次頻繁更新Flash
Gemini 3.6 Flash 在 7 月 21 日發布,3.7 在 8 月 13 日接著上線,3.8 又在 9 月 2 日推出。前兩次相隔 23 天,後兩次相隔 20 天;Google 因此把 3.8 稱為六週內第三款 Flash。
版本號跳得快,不能直接解讀成 Google 每三週重訓一次大型 foundation model。3.8 模型卡明確寫它是「based on Gemini 3.7 Flash」,官方沒有公開參數量、資料量或完整訓練流程。較合理的說法是 Google 在 3.7 基礎上持續改良,但無法再推論哪些進步來自 supplemental training、後訓練、工具流程或其他方法。
3.5 Pro 與 Gemini 4 沒有同步發布
3.7 發布時,另一個問題是「為什麼一直更新 Flash,3.5 Pro 和 Gemini 4 呢?」這次公告仍沒有發布 3.5 Pro,也沒有給出 Gemini 4 上線時間。最近可確認的官方進度仍是 Alphabet 2026 年第二季說明:3.5 Pro 正在測試,Gemini 4 已開始預訓練。3.8 Flash 的出現沒有改變這兩項狀態。
長時間 coding 與 Agent 提升多少
Google 的模型卡顯示,3.8 對 3.7 的提升集中在長時間軟體工程、終端機操作與電腦操作。DeepSWE v1.1 增加 8.4 個百分點,Terminal-bench 4.0 增加 7.9 個百分點,OSWorld-2.0 增加 8.4 個百分點;一般知識推理的 HLE-Verified 則只增加 1.3 個百分點。
| 官方評測 | 3.8 Flash | 3.7 Flash | 變化 |
|---|---|---|---|
| DeepSWE v1.1 | 73.7% | 65.3% | +8.4 |
| Terminal-bench 2.1 | 89.4% | 85.8% | +3.6 |
| Terminal-bench 4.0 | 19.1% | 11.2% | +7.9 |
| OSWorld-2.0 | 59.0% | 50.6% | +8.4 |
| GDPVal-AA v2 | 1545 | 1482 | +63 |
| Vals Finance Agent v2 | 61.4% | 59.0% | +2.4 |
| Harvey’s Legal Agent | 10.0% | 8.8% | +1.2 |
| HLE-Verified | 54.9% | 53.6% | +1.3 |
這些分數來自 Google 模型卡列出的測試設定,不是使用任何 coding agent 都會得到相同成功率。模型、agent harness、thinking level、工具權限與題目版本都會影響結果;3.8 公告也沒有更新 3.7 舊文使用的 FrontierCode、WebDev Arena 與 AutomationBench,不能假設那些項目也依同樣比例提升。
3.7 的 DeepSWE 落後問題大致補上
3.7 Flash 發表時,DeepSWE 65.3% 低於 GPT-5.6 Terra 的 69.6%,也略低於當時約 67% 的 Luna,因此長時間 repository coding 是它相對同業的弱項。3.8 提高到 73.7%,已高於 GPT-5.6 Sol 的 72.7% 與 Terra 的 69.6%,距 Claude Opus 5 的 74.0% 只差 0.3 個百分點。
圖中的 GPT-5.6 Sol $4/$20 是至少到 2026 年 11 月 21 日的促銷價。Sol 與 Terra 的單次輸入超過 272K tokens 時,整個請求會改按 input 2 倍、output 1.5 倍計價,不是只有超出部分加價。
這仍不是「全面超越」。Terminal-bench 4.0 的 19.1% 低於 Opus 5 的 51.8%、Sol 的 37.3% 與 Terra 的 23.6%;OSWorld-2.0 的 59.0% 也低於 Opus 5 的 75.4% 和 Sol 的 62.6%。3.8 比較像是補上前代的長時間 coding 缺口,而不是在每一種終端機與電腦操作任務都排第一。
單價相同,任務成本可能更高
3.8 與 3.7 Flash 的 Standard API 單價相同。2026 年 12 月 31 日以前,每百萬輸入/輸出 token 是 0.75/3.75 美元;2027 年 1 月 1 日起恢復為 1.50/7.50 美元。這仍是限時價格,不是永久定價。
| 服務層級 | 2026 年底前 Input | 2026 年底前 Output | 2027 年起 Input/Output |
|---|---|---|---|
| Standard paid | $0.75 | $3.75 | $1.50/$7.50 |
| Batch/Flex | $0.375 | $1.875 | $0.75/$3.75 |
| Priority | $1.35 | $6.75 | $2.70/$13.50 |
| Standard context cache | $0.075;儲存 $0.50/百萬 tokens/小時 | $0.15;儲存 $1.00/百萬 tokens/小時 | |
Google 說明 3.8 在複雜任務會進行更多 reasoning steps、反覆呼叫工具並驗證結果,尤其 high thinking 更明顯。Output 計價包含 thinking tokens,因此同一個提示即使最後答案一樣長,也可能因內部推理與工具工作增加而變貴。正確比較方式不是只看牌價,而是記錄完成率、重試次數、延遲及每項成功任務使用的總 token。
Interactions API 的 usage 資料可分別查看 total_input_tokens、total_output_tokens、total_thought_tokens、total_cached_tokens、total_tool_use_tokens 與 total_tokens。升級前後各跑一小批代表性工作,就能看出品質提升是否抵消額外推理成本。
Gemini 3.8 Flash 的官方使用建議與提示詞範本
Google 沒有另外發布一份只屬於 3.8 Flash 的提示詞文件,但 3.8 模型頁直接連到 Gemini 3 提示策略。官方重點是直接、清楚與結構一致:把角色、限制和輸出格式放在 system instruction 或提示開頭,不要以過度冗長的背景讓模型先猜任務。
日常問答、分類、草稿與即時分析可先用 low;coding、研究和多工具 Agent 使用預設的 medium;只有高難度推理、多步驟決策或 medium 無法穩定完成時再用 high。如果核心要求是最低延遲與 token,Google 反而建議保留 3.7 Flash。
時效問題的日期與搜尋設定
3.8 Flash 的 knowledge cutoff 標為 2026 年 3 月,而且部分領域可能只到 2025 年 1 月。Google 建議在需要最新資料的工作中,把目前日期放進 system instruction,並啟用 Google Search grounding。以下是依官方格式改寫、可放在 Google AI Studio「System Instructions」或 API system_instruction 的繁中版本:
目前日期是 {{YYYY 年 MM 月 DD 日}}。處理新聞、價格、版本、人物職稱或其他可能變動的資訊時,先使用 Google Search 查證,再回答。清楚區分搜尋取得的現況、模型既有知識與你的推論;找不到官方資料時直接說明。
長文件的資料與任務順序
長 context 不代表把問題埋在文件中間也能得到同樣穩定的結果。官方建議先放完整資料,再在最後提出具體任務,並明寫「根據上述資料」。以下範本依官方建議改寫,可放在 AI Studio 對話框、API user message 或 Agent 的任務描述:
<資料>
{{貼上文件、程式碼、紀錄或會議內容}}
</資料>
根據上述資料完成以下任務:
1. 列出三個最重要的結論。
2. 每個結論附上資料中的直接依據。
3. 資料沒有提供的內容標記為「資訊不足」,不要自行補完。
輸出格式:先給 100 字摘要,再用表格列出結論、證據與不確定性。
Agent 的規劃、執行、驗收與進度規則
Google 對 Agent 工作的建議可整理成 Plan → Execute → Validate → Format。除了交代目標,也要寫清楚可以讀寫什麼、哪些動作要先確認、失敗時何時停止,以及長任務如何回報進度。以下範本依官方建議改寫,適合放進 Antigravity 專案指令、coding agent 規則或 API 的 system instruction:
先讀取需求與現有檔案,提出最小可行計畫,再開始修改。
執行規則:
- 只修改與任務直接相關的檔案,不擴大範圍。
- 可執行唯讀檢查與既有測試;安裝套件、刪除資料或對外發布前先取得確認。
- 長時間工作開始前說明下一步,期間簡短回報已完成事項與發現。
- 遇到同一錯誤兩次後停止,整理錯誤與可行替代方案。
驗收:完成後重新執行直接相關的測試,逐項核對需求。最後回覆修改內容、驗證結果、未解風險與檔案清單。
只依資料回答時的停止條件
合約、政策、研究或內部文件最怕模型把常識混進來源。官方 grounded assistant 方法是限制答案只能使用提供的資料,缺少依據就明說無法回答。以下範本依官方方法改寫,可放在 system instruction,再把文件當成 user message:
你是依資料回答的助理。只能使用使用者提供的內容,不可加入外部知識、常識推測或未標示的假設。每個重要結論都要指出依據;若資料沒有直接支持答案,請回覆「根據目前提供的資料無法判定」,並列出還需要哪些資訊。
從哪裡使用 Gemini 3.8 Flash
| 入口 | 使用方式 | 適合對象 |
|---|---|---|
| Gemini app | Google AI Pro/Ultra 可使用 3.8 Flash | 一般問答、研究與檔案工作 |
| Google AI Mode | Google AI Pro/Ultra 可使用 | 搜尋與複雜問題 |
| Google Sheets | Pro/Ultra 方案內使用 | 試算表分析與整理 |
| Google AI Studio | 選擇 gemini-3.8-flash | 測試提示詞與 API |
| Gemini API | 在 request 指定模型 ID | 自建應用與 Agent |
| Android Studio | 開發工具內使用 | Android 開發者 |
| Google Antigravity | coding agent 內選用 | 程式開發與網站工作 |
| Gemini Enterprise | 企業平台內使用 | 公司資料與工作流程 |
Gemini API 有免費層,但額度與速率限制較低,而且免費服務的內容可用於改善 Google 產品;付費層內容不會用於改善產品。Gemini app、AI Mode 與 Sheets 的 3.8 Flash 入口提供給 Google AI Pro/Ultra 訂閱者,不能把 API 已 GA 解讀成每個免費 Gemini 帳號都會出現模型選單。
3.7 Flash 需要立刻升級嗎
不需要。3.7 Flash 仍是 GA,官方棄用清單沒有列出關閉日期;Google 也明確表示,效率優先的工作可以繼續使用 3.7。3.8 的主要理由是提高複雜任務成功率,而不是強制所有流量換版。
| 工作類型 | 建議 | 原因 |
|---|---|---|
| 分類、摘要、短文改寫 | 先保留 3.7/low | 延遲與 token 比額外推理重要 |
| 一般 coding 與工具流程 | 測試 3.8/medium | 預設設定,品質與成本較平衡 |
| 長時間 repository 修改 | 優先評估 3.8/medium | DeepSWE 改善幅度較大 |
| 高難度多步驟決策 | 再測 3.8/high | 可能提高完成率,也會增加延遲與 token |
| 正式大量流量 | 先做小比例 A/B | 觀察成功任務成本與 timeout,不只看牌價 |
評估時應固定相同提示詞、工具、資料、重試規則與驗收方式,再比較完成率、總 token、p95 延遲和錯誤率。若 3.7 已能一次完成任務,3.8 多出的思考不一定有價值;若工作常因計畫、工具選擇或驗證不足而失敗,3.8 才可能用較高單次成本換到較低重試成本。
API 遷移檢查清單
從 3.7 升到 3.8,第一步是把模型 ID 改成 gemini-3.8-flash,再重跑自己的評測。規格相近不代表行為完全相同,尤其要檢查 thinking token、工具呼叫次數、timeout 與輸出格式。
- Thinking:使用
low、medium或high;不要送出不支援的minimal。 - 取樣參數:從較舊 Gemini 遷移時移除
temperature、top_p、top_k與candidate_count,避免覆蓋模型最佳預設。 - Thinking 設定:把舊的
thinking_budget改為thinking_level。 - 多輪對話:使用 Interactions API 的
previous_interaction_id,不要預先填入模型回覆。 - GenerateContent function calling:保留
call_id與函式名稱,確認工具結果能對應原呼叫。 - Thought signature:使用 Gemini 3 的 function calling 時保留模型回傳的 thought signature,不要自行合成或刪除。
- 成本觀察:分開記錄 input、output、thought、cached 與 tool-use tokens,並設定可接受的 timeout 和重試上限。
正式流量建議先切一小部分到 3.8,確認結構化輸出 schema、函式呼叫與長 context 都正常,再逐步提高比例。只換模型 ID 後看到 HTTP 200,不代表回覆品質、成本和 agent 行為都已通過遷移。
Gemini 3.8 Flash 的使用限制
3.8 Flash 仍會產生不正確資訊,也可能在高 effort 或長工具鏈中變慢、timeout 或使用比預期更多的 token。需要最新資料時應啟用 Search grounding;需要關鍵事實、法律、財務或醫療判斷時,仍要回到原始資料與專業審核。
模型卡的自動化安全評測中,Multilingual Safety 相較 3.7 增加 5.4 個百分點、Unjustified-refusals 增加 1.1 個百分點,而這兩項都是越低越好。Google 表示人工檢查後,多數差異屬於 false positive 或非嚴重案例。這是安全測試的退步訊號,不等於繁體中文整體品質下降 5.4%,但部署多語言客服或內容審核時仍值得把誤拒答納入測試。
最後,3.8 Flash 只能輸出文字。它雖然能理解圖片、音訊與影片,但不能直接產生這些媒體;也不支援需要即時語音串流的 Live API。多模態「理解」與多模態「生成」是兩件不同的事。
常見問答
Gemini 3.8 Flash 是正式版嗎?
是。gemini-3.8-flash 是 GA 模型,可用於正式服務,不是 Preview 模型。
Gemini 3.8 Flash 可以免費用嗎?
Gemini API 有免費層,但速率與額度限制較低,內容可用於改善 Google 產品。Gemini app 的 3.8 Flash 入口提供給 Google AI Pro/Ultra 訂閱者。
Gemini 3.8 Flash 能生成圖片嗎?
不能。它可以理解圖片並輸出文字,但 image generation 不在支援功能內;產圖要改用 Gemini Image 系列。
3.7 Flash 已經要停用了嗎?
沒有。3.7 Flash 仍是 GA,官方棄用清單目前沒有關閉日期,而且 Google 建議效率優先的工作可以繼續使用。
一般使用者可以選 3.8 Flash Cyber 嗎?
目前不行。Cyber 版本只透過 Fairwind Program 提供給通過審核的資安防禦機構,不是公開 API 或一般 Gemini app 模型。
參考來源
- Google:Gemini 3.8 Flash 與 3.8 Flash Cyber 發表公告
- Google AI for Developers:Gemini 3.8 Flash 模型規格
- Google DeepMind:Gemini 3.8 Flash 模型卡
- Google AI for Developers:Gemini API 價格
- Google AI for Developers:Gemini 3 提示策略
- Google AI for Developers:最新模型與遷移指南
- Google AI for Developers:Token 使用量與計算
- Google AI for Developers:模型棄用與關閉日期
- Google:Alphabet 2026 年第二季說明
- OpenAI Developers:GPT-5.6 Sol 模型與價格
- OpenAI Developers:GPT-5.6 Terra 模型與價格