NVIDIA Nemotron 3.5 Lightning 發表|30B 模型只有 3B 啟動,適合本機 AI 嗎?

NVIDIA 發表 Nemotron 3.5 Lightning 30B-A3B,採用 Mamba-2、MoE 與 Attention 混合架構,總參數量 30B,每次推論約啟動 3B,支援推理模式、工具呼叫與最高 100 萬 token context。本文說明 30B-A3B 的意思、開放權重與量化版本差異、Ollama 安裝方式,並在 Mac mini M4 32GB 實測 Q4_0 的載入時間、記憶體占用、prefill 與生成速度,評估它是否適合一般電腦執行本機 AI。