AMD 在 2026 年 8 月 27 日發表 ROCm 10。這次不只是 runtime、函式庫與框架版本更新,ROCm.AI 也正式上線,把 AI coding agent、統一 CLI 與自動效能優化帶進 AMD GPU 開發流程。

不過,ROCm.AI 已經正式推出,不代表裡面的每項工具都進入穩定階段。ROCm CLI 仍是 Technology Preview,官方列出的六個已知問題也直接影響部分 Radeon、Ryzen AI 與 Instinct 工作負載。現有環境適合先並行驗證,不宜只看主要版本號就全面升級。

AMD ROCm 是什麼

ROCm 是 AMD 維護的開放 GPU 運算平台,用來在 AMD Instinct 加速器、部分 Radeon 顯示卡與 Ryzen AI 處理器上執行 AI 推論、模型訓練和高效能運算。它包含 runtime、HIP 程式模型、編譯器、數學函式庫、效能工具,以及 PyTorch、JAX、TensorFlow 等框架的整合。

ROCm 不等於單一顯示卡驅動。驅動只處理硬體與作業系統的連接;ROCm 還要讓框架、函式庫和 GPU kernel 在相容的硬體與 OS 組合上運作。因此,看到「ROCm 支援 Windows」或「支援 Radeon」時,仍要回到 ROCm 10 compatibility matrix 核對具體 GPU、框架與版本,不能推論所有 AMD 顯示卡都能執行同一套工作負載。

本站的 Ollama 完整教學 曾提到 AMD GPU 需要相容的 ROCm 驅動;ROCm 10 則改變整個軟體堆疊的建置、發行和 Agent 工作流。AMD 的 發表公告 將 ROCm.AI 列為這次主要更新,Core SDK release notes 則涵蓋硬體、OS、框架與相容性變更。



Sponsored Links

ROCm 10 改變了哪些開發流程

ROCm 10 的發行基礎改為 TheRock。這套開源建置系統在 ROCm 7.14 進入 production,現在從 primitives、函式庫到 framework wheels 都由同一條 pipeline 建置與驗證。AMD 也把 ROCm 套件、amdgpu driver 與公開 GPU 工具逐步集中到同一個 repository,並支援多個 ROCm 版本與架構並存。

對維護開發機、CI image 或離線 mirror 的團隊,這項改變比版本號更實用。測試環境可以固定既有 runtime,再用另一個環境驗證 ROCm 10,不必先覆蓋目前能工作的組合。AMD 表示 ROCm 10 後續 minor release 約每六週推出一次,長期部署仍需要固定版本與明確的升級窗口。

ROCm.AI 的三個元件由上到下分成 AMD Skills 知識工作流、ROCm CLI 環境管理與 Hyperloom 效能優化
三個元件用途不同,成熟度也要分別確認。

ROCm.AI 的三個元件成熟度不同

ROCm.AI 整合 AMD Skills、ROCm CLI 與 Hyperloom,但三者用途不同。AMD Skills 把 AMD 維護的操作知識與腳本交給 Claude Code、Codex、Cursor 等 coding agent;ROCm CLI 管理安裝、環境、診斷、模型服務與 runtime;Hyperloom 則針對推論工作負載反覆進行 profiling、修改、benchmark 與正確性驗證。

元件主要用途2026-08-29 狀態與限制
AMD Skills讓 coding agent 套用 AMD 驗證過的安裝、診斷與部署流程公開 catalog 已可安裝,但個別 skill 可能仍是 Tech Preview,部分項目也標示 planned
ROCm CLI管理環境、檢查問題、啟動模型服務與監看 runtimeTechnology Preview;可在 Linux、Windows 使用,但 ROCm 10 官方支援仍標示 coming soon
Hyperloom自動找出推論瓶頸並測試主機端與 GPU kernel 優化主要端到端流程驗證 MI300X、MI325X、MI355X 與 SGLang、vLLM,另可接 custom benchmark;TraceLens 不限這三款 GPU

AMD Skills 官方 catalog 已提供 client、cross-stack 與 server 三類工作流。不過,catalog 也明確區分 in-repo、planned 與 Tech Preview,安裝後仍應檢查實際 skill 的狀態。Hyperloom 的 compatibility matrix 將主要端到端優化流程的驗證硬體列為 MI300X、MI325X、MI355X,預設支援 SGLang、vLLM,也能用 custom 接自訂 benchmark script;HIP、Triton 與 FlyDSL 是列入支援的 kernel 語言。當中的 TraceLens 是硬體無關元件,不受這三款 GPU 限制。

3.3 倍推論與 2.4 倍訓練不代表一般升級幅度

AMD 公布 ROCm.AI 平均帶來 3.3 倍推論效能與 2.4 倍訓練效能,但這兩個數字不是「安裝 ROCm 10 就會得到的固定加速」。測試使用 8 張 AMD Instinct MI355X,比較 ROCm 7.0 與加入 optimized kernels、parallelism、scheduling 等優化的 ROCm.AI 預覽堆疊。

推論數字是 GLM-5、Kimi-K2.5、DeepSeek-R1-0528 三個模型的綜合平均;訓練數字則來自 Megatron-LM 執行 DeepSeek-V2-Lite、DeepSeek-V3-16B 與 Qwen3-30B-A3B。框架版本、container、模型與優化設定都不相同,因此不能把結果外推到單張 Radeon、Ryzen AI、ComfyUI 或既有 PyTorch 專案。

ROCm 10 的六個已知問題

ROCm 10 release notes 列出的已知問題涵蓋資料中心與消費級硬體。下面六項會直接改變是否適合立即升級的判斷:

工作負載官方列出的受影響條件可能症狀升級判斷
Hugging Face 模型訓練AMD Instinct MI350X;包含 BART、GPT-2、DiT、BERT、Llama 2 70B Chat、RoBERTa-largetraining throughput 可能倒退 9%~25%先用既有模型與 batch 設定比較吞吐
JAX BERT FP16 訓練部分 Radeon,例如 Radeon PRO W7900segmentation fault依賴這條路徑時暫緩正式環境升級
PyTorch 訓練與 fine-tuningLlama-Factory/Unsloth;例如 RX 9070 系列、Radeon AI PRO R9700GPU reset 或 crash保留可回復的既有環境並先做小規模驗證
SGLang 推論預設 AITER attention backend;例如 W7900、R9700、RX 9070 XT推論可能失敗核對官方 workaround 與實際 backend
TensorFlow ROCm 2.21用 pip packages 安裝 ROCm 的部分 Radeon,例如 R9700libhipsparse ImportError,程式可能無法啟動TensorFlow 專案先確認修正版本
vLLM 或 ComfyUIgfx1103(RDNA 3)Ryzen AI 系統間歇 segmentation fault 或 GPU hang本機推論與生圖主機先留在已驗證版本

表中的型號是 AMD 點名的範例或架構,不代表同系列全部受影響,也不是完整排除清單。AMD 的 ROCm 10 release notes 會列出受影響組合與 workaround,compatibility matrix 則決定特定 GPU、OS、Python 與框架版本是否在正式支援範圍。兩份資料都要核對。

哪些環境適合現在升級

新建環境、需要 ROCm 10 新硬體支援,或準備在 Instinct 上評估 vLLM、SGLang 與 Hyperloom 的團隊,可以直接建立獨立的 ROCm 10 測試環境。先記錄目前模型、container、driver、framework 與吞吐基準,再比較正確性、速度、記憶體與穩定性,才能分辨版本更新和 workload tuning 各自帶來的影響。

現有 ROCm 7.x 已穩定運作,而且碰到前述六項工作負載的正式環境,適合先保留原版本。ROCm 10 支援多版本並存,升級策略可以是「建立新環境、重跑代表性工作、確認回復方式、再移轉」,不用把主要機器當成第一個測試點。實際轉移方式依 AMD 的 TheRock transition guideROCm 10 安裝文件 操作;本文處理的是升級前評估,不是逐步安裝教學。

一般 Radeon 或 Ryzen AI 使用者若只是執行 llama.cpp、Ollama 或 ComfyUI,也不需要為 ROCm.AI 的名稱立即升級。ROCm CLI 與 Hyperloom 目前的成熟度和硬體範圍,未必能改善既有工作流;等 compatibility matrix 與 release notes 明確涵蓋目前設備,再升級同樣是合理選擇。

ROCm 10 升級流程依序是核對硬體與作業系統、檢查已知問題、在獨立環境並行驗證,確認結果後再移轉正式工作負載
先並行驗證,確認結果後再移轉正式工作負載。

常見問答

ROCm 10 可以取代 NVIDIA CUDA 嗎?

ROCm 是 AMD GPU 的運算平台,CUDA 是 NVIDIA GPU 的平台,不能在同一套硬體上直接互換。PyTorch、vLLM 等上層框架可能同時支援兩邊,但可用的 kernel、container、硬體與效能調校仍不同。選擇前要依實際 GPU 與工作負載核對支援矩陣。

ROCm.AI 是新的 AI 模型嗎?

不是。ROCm.AI 是 AMD 的 AI 開發體驗,將 Skills、CLI 與效能優化工具接到 ROCm 軟體堆疊。它會使用 coding agent 或 LLM 協助操作與優化,但本身不是用來聊天或生成內容的 foundation model。

ROCm 10 支援所有 AMD Radeon 與 Ryzen AI 嗎?

不支援所有型號,也不是每個支援型號都能使用全部框架。硬體架構、OS、Python、PyTorch/JAX/TensorFlow 版本與工作負載都會改變支援範圍,安裝前應以 ROCm 10 compatibility matrix 的具體組合為準。

參考來源


Sponsored Links

發佈留言