Google 在 2026 年 8 月 13 日發布 Gemini 3.7 Flash,距離 3.6 Flash 上線只有三週。gemini-3.7-flash 已經是 Gemini API 的正式版(GA)模型,可以用於正式服務。

3.7 Flash 的重點是程式開發與 Agent。Google 公布的 DeepSWE v1.1 從 3.6 Flash 的 49% 提高到 65.3%,FrontierCode 1.1 Main 從 34.4% 提高到 43.6%。2026 年底前 Standard API 付費層促銷價是每百萬輸入/輸出 Token 0.75/3.75 美元,正好是 3.6 Flash 原價的一半。

Gemini 3.7 Flash 規格與發布狀態

項目Gemini 3.7 FlashGemini 3.6 Flash
API 狀態GAGA
模型 IDgemini-3.7-flashgemini-3.6-flash
上下文長度1M Token1M Token
最大輸出64K Token64K Token
Thinking Levellow/medium/highlow/medium/high
預設 Thinking Levelmediummedium
主要定位程式開發、Agent、網頁與複雜知識工作大量 Agent 與多模態工作

輸入仍支援文字、圖片、影片、音訊與 PDF,輸出是文字,內建工具也和 3.6 Flash 相同。Google 這次沒有擴大上下文長度或最大輸出,而是改善第一次產生程式碼的準確度、遇到阻礙時的調整能力、指令遵循,以及多步驟規劃與工具呼叫。



Sponsored Links

三週後推出 3.7 的原因

Gemini 3.6 Flash 在 7 月 21 日發布,3.7 Flash 在 8 月 13 日接著上線。Google 對這段短週期的官方說法,是開發者意見與新的演算法改進促成 3.7,這些改進之後也會帶進其他模型。

官方沒有公開 3.7 Flash 的參數量、訓練資料與訓練方式,因此無法從三週間隔判斷訓練規模。Google 只表示這次發布來自開發者意見與演算法改進,沒有說明是否重新進行大型預訓練。

Gemini 3.6 Flash 於 2026 年 7 月 21 日發布,Gemini 3.7 Flash 於 8 月 13 日發布,兩者相隔三週的時間線
3.6 與 3.7 Flash 的發布時間相隔三週。

程式開發與 Agent 提升多少

Google 公布的比較都以 3.6 Flash 為基準。提升最明顯的是需要長時間修改程式的 DeepSWE v1.1,增加 16.3 個百分點;AutomationBench 的企業自動化任務增加 13.4 個百分點。這些數據來自不同測試,不能直接相加或當成日常工作成功率。

評測3.7 Flash3.6 Flash測試方向
DeepSWE v1.165.3%49.0%長時間軟體工程
FrontierCode 1.1 Main43.6%34.4%真實程式開發
WebDev Arena1588 Elo1538 Elo網頁開發偏好
GDP.pdf34.0%22.0%複雜文件與知識工作
AutomationBench30.4%17.0%企業流程自動化

DeepSWE v1.1 測的是模型能否以 Agent 方式在真實程式碼 repository 裡長時間定位問題、跨檔案修改並完成測試。3.7 Flash 雖然從 49% 提高到 65.3%,這項評測的榜面分數仍略低於更便宜的 GPT-5.6 Luna 約 67%,也低於同級 GPT-5.6 Terra 的 69.6%;因此,長時間 repository 層級的軟體工程仍是它相對同業的弱項,不能只看到相對前代的提升。不過與 Luna 僅差約 1.7 個百分點,實際選型仍要用自己的專案測試成功率、修改品質與重試次數。

Gemini 3.7 Flash 與 3.6 Flash 在 DeepSWE、FrontierCode、GDP.pdf 與 AutomationBench 的官方分數長條圖
3.7 Flash 的提升集中在程式開發與多步驟工作。

與 GPT-5.6、Claude 的能力比較

跨公司比較不能只看一項跑分。閱讀表格前,可以先用兩句話理解這兩項評測:

  • Intelligence Index:整合知識、推理、程式開發、終端機操作與 Agent 任務等多種測試,用一個分數觀察模型的整體能力;分數越高越好。
  • DeepSWE v1.1:讓 coding Agent 在真實的開源程式專案中處理長時間工程任務,包括理解既有程式、跨檔案修改並通過測試;百分比越高,代表完成的任務越多。

以下數據截至 2026 年 8 月 14 日。最新版 Claude 中,Sonnet 是 Claude Sonnet 5;Haiku 目前仍是 2025 年發布的 Claude Haiku 4.5。

模型官方定位Intelligence IndexDeepSWE v1.1
Gemini 3.7 Flash複雜 Agent 與多模態工作5665.3%(high)
GPT-5.6 Terra智慧與成本平衡5769.6%
GPT-5.6 Luna低成本、高流量工作51約 67%(max)
Claude Sonnet 5速度與智慧平衡55約 54%(max)
Claude Haiku 4.5高速、低成本工作30尚無公開結果
Gemini 3.7 Flash、GPT-5.6 Terra、Luna 與 Claude Sonnet 5 的 Intelligence Index 和 DeepSWE v1.1 能力比較圖
綜合分數接近,DeepSWE 的長時間軟體工程才拉開差距。

綜合指標裡,Terra 57、Gemini 3.7 Flash 56、Sonnet 5 55,三者落在相近區間,因此把 3.7 Flash 視為 Terra/Sonnet 這一級比較合理。Luna 的綜合分數是 51,整體略低一級;但是它在 DeepSWE 約 67%,反而略高於 3.7 Flash 的 65.3%。換句話說,Luna 的長時間 coding 能力高於它的產品階層給人的直覺,不能因為價格較低就先排除。

DeepSWE 官網同時提醒,相鄰模型的信賴區間經常重疊:目前榜上 3.7 Flash 約為 65%±2%、Luna 為 67%±4%,因此 1.7 個百分點不一定代表穩定的能力差距;不過榜面上 Luna 較高仍應如實列出。相對地,3.7 Flash 在 FrontierCode、網頁開發、企業自動化、PDF 理解、長影片與長 context 等項目有領先 Terra 或 Sonnet 5 的成績,優勢比較偏向多模態、前端與複雜工具流程。

Haiku 4.5 雖然是最新版 Haiku,但它的 Intelligence Index 只有 30,context window 也是 200K,而其他四款是 1M 左右。它適合回應速度優先的摘要、分類與簡單 coding,不屬於 Gemini 3.7 Flash 的同級對手;放進表格是為了讓讀者看清 Claude 產品線的價格與能力落差,不是把五款模型硬排成同一級。

Standard API 限時半價與恢復日期

2026 年 12 月 31 日以前,Standard API 付費層每百萬輸入 Token 是 0.75 美元,輸出 Token 是 3.75 美元。2027 年 1 月 1 日恢復為 1.50/7.50 美元。這是促銷價格,不是永久降價。

Google 也把同一組 Standard 促銷價套用到 3.6 Flash,因此現階段兩款模型的 Standard API 標價相同。Batch 與 Flex 促銷價是 0.375/1.875 美元,Priority 則是 1.35/6.75 美元。新專案通常可以直接測試 3.7 Flash;既有系統仍要用自己的任務比較輸出品質、Token 用量與重試次數。每 Token 半價不保證每項任務成本一定減半。

相近能力模型的價格比較

Gemini 3.7 Flash、GPT-5.6 Terra 與 Claude Sonnet 5 的綜合分數接近;Luna 的綜合分數略低,但 DeepSWE 約 67%,與 Gemini 的 65.3% 落在相近區間,因此價格比較也納入 Luna。GPT-5.6 各階層的定位與規格可參考 GPT-5.6 發表整理

Gemini 3.7 Flash、GPT-5.6 Terra、Luna 與 Claude Sonnet 5 的 Standard API 每百萬 Token 價格及長上下文加價比較
Luna 的 DeepSWE 分數接近 Gemini,API 單價則明顯更低。
模型目前 Input目前 Output促銷後/備註
Gemini 3.7 Flash$0.75$3.752027 年起 $1.50/$7.50
GPT-5.6 Terra$2.00$12.00目前沒有促銷到期日
GPT-5.6 Luna$0.20$1.20目前沒有促銷到期日
Claude Sonnet 5$2.00$10.002026 年 9 月起 $3.00/$15.00

單看目前 Standard API 牌價,Luna 的 $0.20/$1.20 最低;Gemini 促銷價是 $0.75/$3.75,恢復原價後仍低於 Terra 與 Sonnet 5。Luna 的價格優勢很大,但它在超長 context 的精確檢索較弱,不能只按 DeepSWE 與價格決定所有工作都改用 Luna。

GPT-5.6 還有一個容易漏算的條件:單次 Input 超過 272K Token,整段 Input 改以 2 倍、Output 改以 1.5 倍計價,不是只有超出的部分加價。Terra 會變成 $4/$18,Luna 則是 $0.40/$1.80。

牌價也不等於完成任務的總成本。模型成功率、重試次數、Thinking Token 與輸出長度都會改變最後帳單;Sonnet 5 的新版 tokenizer 也可能讓同一段內容比 Sonnet 4.6 產生約 1.0 到 1.35 倍 Token,Anthropic 才以限時價格降低遷移期間的成本落差。

Thinking Level 與 API 遷移

直接使用 Gemini app 或 Antigravity 的使用者不必設定 API 參數。自建 API 流程可以選擇 low、medium 或 high:low 適合回應時間敏感的工作,medium 是預設值,high 會增加推理與工具使用,適合較難的數學、程式開發與 Agent 任務,但也會消耗更多 Token。

從 3.6 Flash 遷移時主要是把模型 ID 改成 gemini-3.7-flash。從 3.5 Flash、3 Flash Preview 或 3.1 Pro 遷移,主要參數變更包括移除 temperaturetop_ptop_kcandidate_count 與預先填入的模型回覆,再把 thinking_budget 改為 thinking_level。多輪對話驗證與 Function Calling 也有其他檢查項目,完整清單以官方 Migration Checklist 為準。

Gemini 3.7 Flash 的使用入口

入口使用方式適合對象
Google AI Studio直接選擇 gemini-3.7-flash測試 Prompt 與 API
Gemini API指定模型 ID自建應用與 Agent
Google Antigravity新預設 Agent 模型程式開發與網站工作
Android Studio開發工具內使用Android 開發者
Gemini Enterprise企業 App 與 Agent Platform公司內部流程
Gemini Spark由 Spark 在背後使用Google AI Pro/Ultra 訂閱者

一般 Gemini 聊天介面沒有全面改成 3.7 Flash。Google 對個人使用者公布的入口是 Gemini Spark:Spark 會在支援地區替 Google AI Pro 與 Ultra 訂閱者處理 Gmail、Google Calendar、Google Docs 等多步驟工作。它是長時間執行的個人 Agent,不等於聊天選單多出「3.7 Flash」按鈕。

3.5 Pro 與 Gemini 4 的進度

3.7 Flash 公告沒有宣布 Gemini 3.5 Pro 上線,也沒有宣布取消。Google 在 7 月仍表示 3.5 Pro 正與合作夥伴測試,準備完成後才會擴大開放;Gemini 4 則已開始預訓練。較完整的時間線可參考 Gemini 3.6 Flash 與 Gemini 4 的整理

目前沒有官方資料證明 3.7 Flash 是 3.5 Pro 的蒸餾版,也不能因為 Flash 版本快速增加,就判定 Pro 已被取代。可確認的只有 Flash 產品線繼續更新,3.5 Pro 沒有新的公開日期。

常見問答

Gemini 3.7 Flash 已經正式發布嗎?

已經發布。Google 在 2026 年 8 月 13 日公布,Gemini API 文件將 gemini-3.7-flash 標為 GA,可用於正式服務。

Gemini 3.7 Pro 也發布了嗎?

沒有。這次發布的是 3.7 Flash,Google 沒有公布 3.7 Pro。原訂 2026 年 6 月推出的 3.5 Pro 仍沒有新的公開日期。

Gemini 3.7 Flash 可以免費使用嗎?

Google AI Studio 與 Gemini API 的 Standard Free Tier 提供免費輸入與輸出 Token,但 Rate Limit 較低,而且內容可能用於改善 Google 產品;付費層有較高限制,內容不會用於改善產品。Gemini app 內的 3.7 Flash 個人入口目前是 Gemini Spark,需要 Google AI Pro 或 Ultra 訂閱。

促銷價什麼時候結束?

Standard API 付費層促銷價適用到 2026 年 12 月 31 日。2027 年 1 月 1 日起,每百萬輸入/輸出 Token 從 0.75/3.75 美元恢復為 1.50/7.50 美元。

3.6 Flash 需要立刻更換嗎?

不必立刻切換。兩款模型目前價格相同,可以先用既有測試集比較成功率、重試次數、延遲與 Token 用量,再決定正式流量是否移轉。官方文件建議的升級方向是 3.7 Flash,但產品環境仍需要自行驗證。

參考來源


Sponsored Links

發佈留言