NVIDIA 在 2026 年 8 月 11 日發布 Nemotron 3.5 Lightning 30B-A3B。名稱裡的 30B 代表模型約有 300 億參數,A3B 則代表處理每個 token 時約啟動 30 億參數。它不是把模型縮成 3B,而是利用 Mixture-of-Experts(MoE)架構,讓每次推論只動用部分專家。
這種設計的重點是降低每次生成的計算量,同時保留較大的模型容量。NVIDIA 把它定位在長時間運作的 Agent、子代理與個人硬體上的高效率推論。除了 NVIDIA 提供的 BF16 與 NVFP4 權重,現在也能透過 GGUF 量化版本在 Ollama 執行。本文使用 Mac mini M4 32GB 實測 Q4_0,看看一般電腦實際跑起來的速度與記憶體需求。
Nemotron 3.5 Lightning 是什麼
Nemotron 是 NVIDIA 的開放權重模型家族,主要面向 Agent、企業客製化與本機推論。Nemotron 3.5 Lightning 採用 Mamba-2、MoE 與 Attention 混合架構:Mamba-2 著重長序列處理效率,Attention 保留對上下文關係的建模能力,MoE 則依 token 選擇需要參與計算的專家。
官方模型卡列出的主要規格如下:
| 項目 | 規格 |
|---|---|
| 總參數量 | 30B |
| 每次啟動參數 | 約 3B |
| 架構 | Mamba-2 + MoE + Attention |
| Context length | 最高 100 萬 token |
| 推理模式 | 可開啟或關閉 |
| Agent 能力 | 支援工具呼叫 |
| 授權 | OpenMDW 1.1,可商業使用 |
「最高 100 萬 token」是模型與官方部署方案支援的上限,不代表把量化模型放進一般電腦後就能直接使用完整長度。Context 越長,KV cache 與執行環境需要的記憶體也會增加。本次 Mac 實測採用 4K context,不能把速度數字延伸解讀成 100 萬 token 的表現。
30B 總參數與 3B 啟動參數的差別
一般 Dense 模型生成每個 token 時,所有主要參數都會參與計算。MoE 模型則把部分參數分成多組專家,再由路由器依照輸入選出需要的專家。Nemotron 3.5 Lightning 雖然共有約 30B 參數,每次處理 token 時只啟動約 3B,因此計算量比「每次都使用完整 30B」低。

啟動參數少,不等於模型檔只剩 3B。推論時仍要保存完整專家權重,Q4_0 GGUF 檔案約 18.9GB;差別主要反映在每次生成需要執行多少計算,而不是硬碟與記憶體只需要 3B 模型的空間。
Mac mini M4 32GB 實測結果
本次在 Mac mini M4、32GB Unified Memory 上使用 Ollama App 0.30.5,執行 GGUF Q4_0 量化版本。測試關閉 thinking、context 設為 4096,固定生成 400 token,暖身後連續執行三次。
| 測試項目 | 結果 |
|---|---|
| 模型檔案 | 約 18.9GB |
| 載入後占用 | 18.68GB |
| 冷載入時間 | 約 41.8 秒 |
| 文字生成速度 | 24.43 ± 0.18 token/s |
| Prefill 速度 | 1,192 token/s |
| Context | 4096 |
24.43 token/s 已能順暢顯示一般對話與長文輸出,連續三次測量只有很小的波動。Prefill 是模型讀取提示詞的階段,1,192 token/s 代表中短篇輸入通常不會等太久。比較明顯的等待發生在第一次載入:模型尚未進入記憶體時,冷啟動約需 41.8 秒;載入完成後,後續生成不必重複等待完整載入時間。
記憶體是更需要留意的限制。Ollama 顯示模型載入後占用 18.68GB,已超過 32GB Unified Memory 的一半。這台 Mac 能完整載入並執行 Q4_0,但同時開啟大量瀏覽器分頁、虛擬機、影像工具或其他高記憶體用量的程式時,可用空間會快速下降。因此「跑得動」不代表適合同時執行多項高記憶體用量工作。
適合本機 AI 嗎
以這次結果來看,Nemotron 3.5 Lightning 適合 32GB 以上、能為模型保留約 19GB 記憶體的電腦。生成速度足以應付聊天、摘要、文件處理與本機 Agent;MoE 讓 30B 模型不必在每個 token 上執行全部參數,正是它能在 Mac mini 保持互動速度的原因。
16GB 電腦不適合直接使用這次測試的 Q4_0 版本,因為光是模型占用就已超過可用容量;24GB 裝置雖可能勉強載入,留給 macOS 與其他程式的空間也很有限。這兩項是根據 18.68GB 實測占用做出的容量判斷,不是另外在 16GB 或 24GB 主機跑出的結果。
另一個界線是長 context。官方支援最高 100 萬 token,但個人電腦要依記憶體縮短 context,不能把資料表上的理論上限當成本機預設值。一般聊天與文件任務可以從 4K 或 8K 開始,再依實際工作逐步增加。
使用 Ollama 安裝 Nemotron 3.5 Lightning
安裝 Ollama
macOS 與 Windows 可以從 Ollama 官方下載頁 安裝 App。macOS 需要 Sonoma 14 以上,下載 DMG 後把 Ollama 拖進 Applications,再開啟一次;App 會檢查終端機能否找到 ollama 指令。Windows 安裝完成後會在背景執行,PowerShell、命令提示字元與 Windows Terminal 都能使用 CLI。
Linux 可以使用官方安裝腳本。安裝完成後先確認 CLI 與服務可以連線:
# Linux 安裝 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# macOS、Windows 與 Linux 都能用這個指令確認安裝
ollama -v
# Linux 若沒有背景服務,可以在一個終端機啟動服務
ollama serve
更完整的 App、CLI、模型儲存位置與 API 操作可參考 Ollama 入門教學 。
下載並執行 Q4_0
本次測試使用 ggml-org 提供的 GGUF Q4_0。第一次執行時,Ollama 會從 Hugging Face 下載約 18.9GB 權重,完成後直接進入互動對話。開始前除了記憶體,也要確認模型磁碟有足夠空間:
# 第一次會下載約 18.9GB,之後直接載入既有檔案
ollama run hf.co/ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_0
# 進入互動模式後直接輸入問題
> 請用繁體中文整理這份需求,列出執行步驟
# 結束互動模式
> /bye
模型支援 thinking 開關,但不同 Ollama 版本與聊天介面的控制方式可能不同。本次速度數字是在 API 請求中關閉 thinking 後測得;若互動介面顯示推理內容,速度與輸出長度不宜直接套用本文數字。
查看占用與釋放記憶體
離開對話不一定會立刻把模型從記憶體移除。32GB 電腦若要接著執行其他高記憶體用量工作,可以查看常駐狀態,再明確停止模型:
# 查看模型是否仍在記憶體,以及實際占用
ollama ps
# 使用完畢後卸載模型,釋放記憶體
ollama stop hf.co/ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_0
Q4_0 是社群轉換的量化權重,不是 NVIDIA 官方模型卡主要驗證的 NVFP4 部署路徑。量化能大幅縮小檔案與記憶體需求,也可能帶來能力差異;本次數字只代表這個 Q4_0 檔案在指定 Mac 與 Ollama 版本下的表現。
BF16、NVFP4 與 GGUF 的用途
NVIDIA 同時提供不同精度與用途的權重。BF16 是完整精度的參考版本,適合後訓練、領域調整、蒸餾與製作其他量化格式;NVFP4 著重 NVIDIA 硬體上的推論效率;GGUF 則常用於 llama.cpp、Ollama 與 LM Studio 等本機工具。
| 版本 | 主要用途 |
|---|---|
| BF16 | 研究、客製化與製作量化版本 |
| NVFP4 | NVIDIA 硬體的高效率部署 |
| GGUF Q4_0 | Ollama 等本機工具,檔案較小 |
這些版本不能只看檔案大小選擇。硬體是否支援對應計算路徑、推論引擎是否完整支援模型架構,以及需要多少 context,都會影響最後速度。對 Apple Silicon 使用者來說,GGUF 是目前較容易開始的方式;NVIDIA 官方部署則以 NVFP4 與 BF16 文件為主。
常見問答
Nemotron 3.5 Lightning 是開源模型嗎
較精確的分類是開放權重模型。NVIDIA 公開模型權重、部分訓練資料與方法,授權採 OpenMDW 1.1,官方模型卡標示可商業使用;但「開源」容易讓人聯想到軟體開源授權與完整重製條件,因此本文不把兩者直接畫上等號。
為什麼只有 3B 啟動,模型仍然需要約 19GB
3B active 指每個 token 參與運算的參數量,不是權重檔案只保存 3B。路由器每次可能選到不同專家,因此完整 30B 專家權重仍要保存在儲存裝置與記憶體中。
支援繁體中文嗎
NVIDIA 模型卡寫到預訓練涵蓋 20 種自然語言,後訓練的主要語言包含中文。本次速度測試也使用繁體中文提示詞並能正常生成。不過官方摘要沒有把中文列在主要支援語言清單,因此較適合先用自己的任務測試用詞、知識與長文穩定性,再決定是否投入正式工作。
可以直接使用 100 萬 token context 嗎
模型架構與官方伺服器部署方案支援最高 100 萬 token,但本機能開多少仍受記憶體、KV cache、推論引擎與量化版本限制。這次 Mac 實測只有 4096 context,沒有測量 100 萬 token 的速度與記憶體。
沒有適合的本機硬體,能在線上使用嗎
可以。NVIDIA Build 提供線上 Playground 與 OpenAI 相容 API,可先測試模型再決定是否部署。本機版本的優點是資料能留在自己的環境;線上 API 則省下下載權重與準備記憶體的工作,兩者的成本與資料處理方式並不相同。