OpenAI 公布首款自研 LLM 推論晶片 Jalapeño 的第一批 InferenceX 實測:三個開放權重模型的峰值吞吐/瓦是比較系統的 1.5 至 1.9 倍,端到端延遲低 1.7 至 3.6 倍。本文整理它與 Broadcom、Celestica 的分工、prefill 與 decode 的設計背景、各模型測試條件、SemiAnalysis 揭露的限制、2026 年底部署時程,以及 ChatGPT、Codex、API 使用者現在能與不能期待的變化。
程式筆記、開發心得、個人部落格
OpenAI 公布首款自研 LLM 推論晶片 Jalapeño 的第一批 InferenceX 實測:三個開放權重模型的峰值吞吐/瓦是比較系統的 1.5 至 1.9 倍,端到端延遲低 1.7 至 3.6 倍。本文整理它與 Broadcom、Celestica 的分工、prefill 與 decode 的設計背景、各模型測試條件、SemiAnalysis 揭露的限制、2026 年底部署時程,以及 ChatGPT、Codex、API 使用者現在能與不能期待的變化。