NVIDIA 發表 Nemotron 3.5 Lightning 30B-A3B,採用 Mamba-2、MoE 與 Attention 混合架構,總參數量 30B,每次推論約啟動 3B,支援推理模式、工具呼叫與最高 100 萬 token context。本文說明 30B-A3B 的意思、開放權重與量化版本差異、Ollama 安裝方式,並在 Mac mini M4 32GB 實測 Q4_0 的載入時間、記憶體占用、prefill 與生成速度,評估它是否適合一般電腦執行本機 AI。
程式筆記、開發心得、個人部落格
NVIDIA 發表 Nemotron 3.5 Lightning 30B-A3B,採用 Mamba-2、MoE 與 Attention 混合架構,總參數量 30B,每次推論約啟動 3B,支援推理模式、工具呼叫與最高 100 萬 token context。本文說明 30B-A3B 的意思、開放權重與量化版本差異、Ollama 安裝方式,並在 Mac mini M4 32GB 實測 Q4_0 的載入時間、記憶體占用、prefill 與生成速度,評估它是否適合一般電腦執行本機 AI。