OpenAI 在 2026 年 8 月 25 日公布首款自研 LLM 推論晶片 Jalapeño 的第一批實測。它在三個開放權重模型上的峰值吞吐/瓦是比較系統的 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。
這些數字來自工程樣品與特定的 InferenceX 工作負載,不能直接解讀成 ChatGPT 已加速、API 已降價,或 OpenAI 不再需要 NVIDIA。比較有用的讀法,是分清楚 Jalapeño 解決哪一段運算、測試涵蓋什麼,以及 2026 年底開始部署後可能先改變哪些體驗。
OpenAI Jalapeño 是什麼
Jalapeño 是 OpenAI 設計的第一款 Intelligence Processor,專門負責大型語言模型的 inference,也就是模型收到提示詞後,處理輸入並逐步產生回答的階段。它不是拿來訓練新模型的晶片,也不是準備安裝在個人電腦裡的顯示卡。
OpenAI 負責晶片架構與 serving software;Broadcom 提供晶片實作與網路技術;Celestica 協助板卡、機櫃與系統整合。Jalapeño 最初會部署在 OpenAI 的運算基礎設施;架構設計參考 ChatGPT、Codex、API 與 Agent 產品的推論需求,但官方尚未公布首批承載哪些產品或模型。
大型模型推論通常得在吞吐量、回應延遲與耗電之間取捨。Jalapeño 把運算、記憶體、網路、排程與模型 kernel 一起設計,目標是在同一套架構上同時提高每瓦能完成的工作,並縮短每位使用者等待 token 的時間。這次新聞的重點不是 OpenAI 第一次展示晶片,而是第一次交出跨三個模型的實測數字與部署時間。
三個模型的 InferenceX 實測結果
OpenAI 使用 SemiAnalysis 的公開 benchmark InferenceX,在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 上比較 Jalapeño 和商用系統。三組測試都是 nominal 8k/1k,也就是約 8,000 tokens 輸入、1,000 tokens 輸出的單輪工作負載,並採 single-token prediction。
| 模型與比較系統 | 峰值 mixed TPS/kW | 端到端延遲 | 最低 TBT |
|---|---|---|---|
| GPT-OSS 120B Jalapeño vs. GB200 | 高約 1.9 倍 | 低約 1.7 倍 | 低約 2.7 倍 |
| DeepSeek R1 670B Jalapeño vs. GB300 | 高約 1.7 倍 | 低約 3.6 倍 | 低約 4.1 倍 |
| Kimi K2.5 1T Jalapeño vs. GB300 | 高約 1.5 倍 | 低約 3.4 倍 | 低約 3.8 倍 |
TPS 是每秒處理的 tokens,TBT(time between tokens)則是回答開始產生後,相鄰 token 之間的等待時間。吞吐/瓦比較的是資料中心用相同電力能服務多少工作;端到端延遲與 TBT 才比較接近使用者感受到的等待。三種指標不能合併成一句「Jalapeño 快 4.1 倍」,因為 4.1 倍只對應 DeepSeek R1 這組測試的最低 TBT。
OpenAI 以各加速器公布的晶片功率正規化吞吐。Jalapeño 的額定功率是 700W,但官方表示這些工作負載的持續實測功率沒有超過 550W;比較系統在表內分別使用 GB200 的 1,200W 與 GB300 的 1,400W package TDP。這種算法適合看晶片層級的能源效率,不等於完整機房的實際電費,冷卻、網路與其他系統耗電仍要另外計算。
InferenceX 數字的限制
SemiAnalysis 表示團隊在 OpenAI 實驗室親眼確認 InferenceX runs,但表中的數字由 OpenAI 提供,而且他們沒有跑完整套 InferenceX,也還沒看到 AgentX 結果。這讓結果比單純的廠商投影片多了一層現場驗證,仍不是完整的獨立測試。
8k/1k 是單輪、固定長度的工作負載,沒有涵蓋長 context、多輪對話與 Agent 長時間執行時,router、prefix cache、cache management 與 offload infrastructure 面對的壓力。SemiAnalysis 也指出,Jalapeño 使用 HBM4,拿尚未量產的工程樣品和 GB200/GB300 比較並不完整;等到實際部署後,還需要和同時期硬體、更多模型與 AgentX 工作負載重新比較。
Jalapeño 如何處理 prefill、decode 與網路等待
LLM 推論不是從頭到尾都做相同工作。Prefill 先讀入整段提示詞,通常需要較多運算資源;decode 一次產生一個 token,瓶頸更常落在記憶體頻寬。模型跨多顆晶片時,權重、KV cache 與中間狀態還要透過網路傳輸,運算單元可能因此等待資料。
Jalapeño 的做法是減少資料搬移,讓模型狀態與 KV cache 可以明確放在較接近運算的位置,再依 prefill 或 decode 的需要調度運算、記憶體與網路。OpenAI 把網路視為晶片架構的一部分,而不是外接配件,希望完整請求都留在同一連接範圍內。這也是它能同時追求高吞吐與低延遲的設計背景。
AI 參與晶片設計與模型最佳化的範圍
OpenAI 與 Broadcom 從初始設計到 manufacturing tape-out 花了九個月。OpenAI 表示模型協助團隊探索實作、縮短設計與驗證迴圈,也用於最佳化算術電路。Tape-out 是晶片設計資料交付製造的節點,不代表九個月內已完成量產與資料中心部署。
晶片進入實驗室後,團隊又用 Codex 搭配 GPT-Astra,在兩個月內把三個原本不在生產計畫內的開放權重模型移植到 Jalapeño。部分 GPT-OSS attention 與 mixture-of-experts blocks 的 AI 產生實作,比原有的人類專家版本快 1.5 至 1.8 倍。這個倍率只適用於選定的 blocks,不是整個 GPT-OSS 模型,也不能當成 Codex 寫任何底層程式都會加速相同比例。
部署時間與 NVIDIA 加速器的關係
OpenAI 計畫在 2026 年底前,開始把 Jalapeño 部署到自己的運算基礎設施。第一代仍處於 production qualification、軟體成熟與大規模營運準備階段;第二代已進入深度開發,第三代則在規劃中。官方沒有公布首批部署量、涵蓋哪些模型、資料中心位置或實際使用比例。
Jalapeño 目前負責 inference,不是 training。OpenAI 同一份公告也寫到,之後仍會大量部署 NVIDIA 與其他夥伴的加速器,支援訓練和推論。因此,自研晶片比較像是在既有算力來源之外增加一條專用路線,不能從第一批 benchmark 推論 OpenAI 已經全面取代 GPU。
ChatGPT、Codex 與 API 使用者會受到什麼影響
Jalapeño 如果按計畫部署,較高的吞吐/瓦能讓 OpenAI 用相同電力服務更多請求;較低的端到端延遲與 TBT,則有機會縮短回答與多步驟 Agent 的等待。Agent 每一步都要等前一步輸出,單步省下的延遲會在長任務中累積,因此 OpenAI 特別強調互動式工作負載。
不過,2026 年 8 月 26 日能確認的仍是晶片層級結果與年底部署計畫。OpenAI 沒有在同一份公告中調整 ChatGPT 方案、Codex 額度或 API 價格,也沒有保證所有模型在部署當天同步加速。現階段不必改設定或程式碼;真正影響要等官方公布產品端 rollout、價格或 service tier 變更。
常見問答
Jalapeño 是 GPU 嗎?
它是 OpenAI 為 LLM inference 設計的 custom accelerator,功能上和資料中心 AI GPU 一樣負責加速模型運算,但架構是依大型語言模型的運算、記憶體與網路需求重新設計。OpenAI 稱它為 Intelligence Processor。
Jalapeño 可以訓練模型嗎?
第一代 Jalapeño 的公開定位是 LLM 推論,不是模型訓練。OpenAI 仍會使用 NVIDIA 與其他夥伴的加速器支援訓練工作。
Jalapeño 何時會用在 ChatGPT 或 Codex?
官方只確認 2026 年底前開始部署到 OpenAI 的運算基礎設施,沒有公布 ChatGPT、Codex 或特定模型的切換日期。部署後也可能先從部分工作負載開始,不能把晶片部署日當成所有產品的功能上線日。