OpenAI 在 2026 年 8 月 25 日公布首款自研 LLM 推論晶片 Jalapeño 的第一批實測。它在三個開放權重模型上的峰值吞吐/瓦是比較系統的 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。

這些數字來自工程樣品與特定的 InferenceX 工作負載,不能直接解讀成 ChatGPT 已加速、API 已降價,或 OpenAI 不再需要 NVIDIA。比較有用的讀法,是分清楚 Jalapeño 解決哪一段運算、測試涵蓋什麼,以及 2026 年底開始部署後可能先改變哪些體驗。

OpenAI Jalapeño 是什麼

Jalapeño 是 OpenAI 設計的第一款 Intelligence Processor,專門負責大型語言模型的 inference,也就是模型收到提示詞後,處理輸入並逐步產生回答的階段。它不是拿來訓練新模型的晶片,也不是準備安裝在個人電腦裡的顯示卡。

OpenAI 負責晶片架構與 serving software;Broadcom 提供晶片實作與網路技術;Celestica 協助板卡、機櫃與系統整合。Jalapeño 最初會部署在 OpenAI 的運算基礎設施;架構設計參考 ChatGPT、Codex、API 與 Agent 產品的推論需求,但官方尚未公布首批承載哪些產品或模型。

大型模型推論通常得在吞吐量、回應延遲與耗電之間取捨。Jalapeño 把運算、記憶體、網路、排程與模型 kernel 一起設計,目標是在同一套架構上同時提高每瓦能完成的工作,並縮短每位使用者等待 token 的時間。這次新聞的重點不是 OpenAI 第一次展示晶片,而是第一次交出跨三個模型的實測數字與部署時間。



Sponsored Links

三個模型的 InferenceX 實測結果

OpenAI 使用 SemiAnalysis 的公開 benchmark InferenceX,在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 上比較 Jalapeño 和商用系統。三組測試都是 nominal 8k/1k,也就是約 8,000 tokens 輸入、1,000 tokens 輸出的單輪工作負載,並採 single-token prediction。

OpenAI Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 的 InferenceX 測試中,分別比較 GB200 或 GB300 的峰值吞吐/瓦、端到端延遲與最低 TBT 倍率
三組結果都同時提高吞吐/瓦並降低延遲。
模型與比較系統峰值 mixed TPS/kW端到端延遲最低 TBT
GPT-OSS 120B
Jalapeño vs. GB200
高約 1.9 倍低約 1.7 倍低約 2.7 倍
DeepSeek R1 670B
Jalapeño vs. GB300
高約 1.7 倍低約 3.6 倍低約 4.1 倍
Kimi K2.5 1T
Jalapeño vs. GB300
高約 1.5 倍低約 3.4 倍低約 3.8 倍

TPS 是每秒處理的 tokens,TBT(time between tokens)則是回答開始產生後,相鄰 token 之間的等待時間。吞吐/瓦比較的是資料中心用相同電力能服務多少工作;端到端延遲與 TBT 才比較接近使用者感受到的等待。三種指標不能合併成一句「Jalapeño 快 4.1 倍」,因為 4.1 倍只對應 DeepSeek R1 這組測試的最低 TBT。

OpenAI 以各加速器公布的晶片功率正規化吞吐。Jalapeño 的額定功率是 700W,但官方表示這些工作負載的持續實測功率沒有超過 550W;比較系統在表內分別使用 GB200 的 1,200W 與 GB300 的 1,400W package TDP。這種算法適合看晶片層級的能源效率,不等於完整機房的實際電費,冷卻、網路與其他系統耗電仍要另外計算。

InferenceX 數字的限制

SemiAnalysis 表示團隊在 OpenAI 實驗室親眼確認 InferenceX runs,但表中的數字由 OpenAI 提供,而且他們沒有跑完整套 InferenceX,也還沒看到 AgentX 結果。這讓結果比單純的廠商投影片多了一層現場驗證,仍不是完整的獨立測試。

8k/1k 是單輪、固定長度的工作負載,沒有涵蓋長 context、多輪對話與 Agent 長時間執行時,router、prefix cache、cache management 與 offload infrastructure 面對的壓力。SemiAnalysis 也指出,Jalapeño 使用 HBM4,拿尚未量產的工程樣品和 GB200/GB300 比較並不完整;等到實際部署後,還需要和同時期硬體、更多模型與 AgentX 工作負載重新比較。

Jalapeño 如何處理 prefill、decode 與網路等待

LLM 推論不是從頭到尾都做相同工作。Prefill 先讀入整段提示詞,通常需要較多運算資源;decode 一次產生一個 token,瓶頸更常落在記憶體頻寬。模型跨多顆晶片時,權重、KV cache 與中間狀態還要透過網路傳輸,運算單元可能因此等待資料。

大型語言模型推論由運算密集的 prefill、受記憶體頻寬限制的 decode,以及可能產生跨晶片等待的 network 階段組成,Jalapeño 將運算、記憶體與網路一起協調
不同推論階段的瓶頸,需要由同一套系統協調。

Jalapeño 的做法是減少資料搬移,讓模型狀態與 KV cache 可以明確放在較接近運算的位置,再依 prefill 或 decode 的需要調度運算、記憶體與網路。OpenAI 把網路視為晶片架構的一部分,而不是外接配件,希望完整請求都留在同一連接範圍內。這也是它能同時追求高吞吐與低延遲的設計背景。

AI 參與晶片設計與模型最佳化的範圍

OpenAI 與 Broadcom 從初始設計到 manufacturing tape-out 花了九個月。OpenAI 表示模型協助團隊探索實作、縮短設計與驗證迴圈,也用於最佳化算術電路。Tape-out 是晶片設計資料交付製造的節點,不代表九個月內已完成量產與資料中心部署。

晶片進入實驗室後,團隊又用 Codex 搭配 GPT-Astra,在兩個月內把三個原本不在生產計畫內的開放權重模型移植到 Jalapeño。部分 GPT-OSS attention 與 mixture-of-experts blocks 的 AI 產生實作,比原有的人類專家版本快 1.5 至 1.8 倍。這個倍率只適用於選定的 blocks,不是整個 GPT-OSS 模型,也不能當成 Codex 寫任何底層程式都會加速相同比例。

部署時間與 NVIDIA 加速器的關係

OpenAI 計畫在 2026 年底前,開始把 Jalapeño 部署到自己的運算基礎設施。第一代仍處於 production qualification、軟體成熟與大規模營運準備階段;第二代已進入深度開發,第三代則在規劃中。官方沒有公布首批部署量、涵蓋哪些模型、資料中心位置或實際使用比例。

Jalapeño 目前負責 inference,不是 training。OpenAI 同一份公告也寫到,之後仍會大量部署 NVIDIA 與其他夥伴的加速器,支援訓練和推論。因此,自研晶片比較像是在既有算力來源之外增加一條專用路線,不能從第一批 benchmark 推論 OpenAI 已經全面取代 GPU。

ChatGPT、Codex 與 API 使用者會受到什麼影響

Jalapeño 如果按計畫部署,較高的吞吐/瓦能讓 OpenAI 用相同電力服務更多請求;較低的端到端延遲與 TBT,則有機會縮短回答與多步驟 Agent 的等待。Agent 每一步都要等前一步輸出,單步省下的延遲會在長任務中累積,因此 OpenAI 特別強調互動式工作負載。

不過,2026 年 8 月 26 日能確認的仍是晶片層級結果與年底部署計畫。OpenAI 沒有在同一份公告中調整 ChatGPT 方案、Codex 額度或 API 價格,也沒有保證所有模型在部署當天同步加速。現階段不必改設定或程式碼;真正影響要等官方公布產品端 rollout、價格或 service tier 變更。

常見問答

Jalapeño 是 GPU 嗎?

它是 OpenAI 為 LLM inference 設計的 custom accelerator,功能上和資料中心 AI GPU 一樣負責加速模型運算,但架構是依大型語言模型的運算、記憶體與網路需求重新設計。OpenAI 稱它為 Intelligence Processor。

Jalapeño 可以訓練模型嗎?

第一代 Jalapeño 的公開定位是 LLM 推論,不是模型訓練。OpenAI 仍會使用 NVIDIA 與其他夥伴的加速器支援訓練工作。

Jalapeño 何時會用在 ChatGPT 或 Codex?

官方只確認 2026 年底前開始部署到 OpenAI 的運算基礎設施,沒有公布 ChatGPT、Codex 或特定模型的切換日期。部署後也可能先從部分工作負載開始,不能把晶片部署日當成所有產品的功能上線日。

參考來源


Sponsored Links

發佈留言