NVIDIA 在 2026 年 8 月 11 日發布 Nemotron 3.5 Lightning 30B-A3B。名稱裡的 30B 代表模型約有 300 億參數,A3B 則代表處理每個 token 時約啟動 30 億參數。它不是把模型縮成 3B,而是利用 Mixture-of-Experts(MoE)架構,讓每次推論只動用部分專家。

這種設計的重點是降低每次生成的計算量,同時保留較大的模型容量。NVIDIA 把它定位在長時間運作的 Agent、子代理與個人硬體上的高效率推論。除了 NVIDIA 提供的 BF16 與 NVFP4 權重,現在也能透過 GGUF 量化版本在 Ollama 執行。本文使用 Mac mini M4 32GB 實測 Q4_0,看看一般電腦實際跑起來的速度與記憶體需求。

Nemotron 3.5 Lightning 是什麼

Nemotron 是 NVIDIA 的開放權重模型家族,主要面向 Agent、企業客製化與本機推論。Nemotron 3.5 Lightning 採用 Mamba-2、MoE 與 Attention 混合架構:Mamba-2 著重長序列處理效率,Attention 保留對上下文關係的建模能力,MoE 則依 token 選擇需要參與計算的專家。

官方模型卡列出的主要規格如下:

項目規格
總參數量30B
每次啟動參數約 3B
架構Mamba-2 + MoE + Attention
Context length最高 100 萬 token
推理模式可開啟或關閉
Agent 能力支援工具呼叫
授權OpenMDW 1.1,可商業使用

「最高 100 萬 token」是模型與官方部署方案支援的上限,不代表把量化模型放進一般電腦後就能直接使用完整長度。Context 越長,KV cache 與執行環境需要的記憶體也會增加。本次 Mac 實測採用 4K context,不能把速度數字延伸解讀成 100 萬 token 的表現。



Sponsored Links

30B 總參數與 3B 啟動參數的差別

一般 Dense 模型生成每個 token 時,所有主要參數都會參與計算。MoE 模型則把部分參數分成多組專家,再由路由器依照輸入選出需要的專家。Nemotron 3.5 Lightning 雖然共有約 30B 參數,每次處理 token 時只啟動約 3B,因此計算量比「每次都使用完整 30B」低。

Nemotron 3.5 Lightning 的 30B 總參數由路由器為每個 token 選擇約 3B 專家參與計算
本機硬體需求仍要按約 18.9GB 的 Q4_0 完整權重估算。

啟動參數少,不等於模型檔只剩 3B。推論時仍要保存完整專家權重,Q4_0 GGUF 檔案約 18.9GB;差別主要反映在每次生成需要執行多少計算,而不是硬碟與記憶體只需要 3B 模型的空間。

Mac mini M4 32GB 實測結果

本次在 Mac mini M4、32GB Unified Memory 上使用 Ollama App 0.30.5,執行 GGUF Q4_0 量化版本。測試關閉 thinking、context 設為 4096,固定生成 400 token,暖身後連續執行三次。

測試項目結果
模型檔案約 18.9GB
載入後占用18.68GB
冷載入時間約 41.8 秒
文字生成速度24.43 ± 0.18 token/s
Prefill 速度1,192 token/s
Context4096
Mac mini M4 32GB 執行 Nemotron 3.5 Lightning 的生成速度、模型占用、冷啟動與 Prefill 實測數據
Q4_0 在 Mac mini M4 32GB 的四項核心實測結果。

24.43 token/s 已能順暢顯示一般對話與長文輸出,連續三次測量只有很小的波動。Prefill 是模型讀取提示詞的階段,1,192 token/s 代表中短篇輸入通常不會等太久。比較明顯的等待發生在第一次載入:模型尚未進入記憶體時,冷啟動約需 41.8 秒;載入完成後,後續生成不必重複等待完整載入時間。

記憶體是更需要留意的限制。Ollama 顯示模型載入後占用 18.68GB,已超過 32GB Unified Memory 的一半。這台 Mac 能完整載入並執行 Q4_0,但同時開啟大量瀏覽器分頁、虛擬機、影像工具或其他高記憶體用量的程式時,可用空間會快速下降。因此「跑得動」不代表適合同時執行多項高記憶體用量工作。

適合本機 AI 嗎

以這次結果來看,Nemotron 3.5 Lightning 適合 32GB 以上、能為模型保留約 19GB 記憶體的電腦。生成速度足以應付聊天、摘要、文件處理與本機 Agent;MoE 讓 30B 模型不必在每個 token 上執行全部參數,正是它能在 Mac mini 保持互動速度的原因。

16GB 電腦不適合直接使用這次測試的 Q4_0 版本,因為光是模型占用就已超過可用容量;24GB 裝置雖可能勉強載入,留給 macOS 與其他程式的空間也很有限。這兩項是根據 18.68GB 實測占用做出的容量判斷,不是另外在 16GB 或 24GB 主機跑出的結果。

另一個界線是長 context。官方支援最高 100 萬 token,但個人電腦要依記憶體縮短 context,不能把資料表上的理論上限當成本機預設值。一般聊天與文件任務可以從 4K 或 8K 開始,再依實際工作逐步增加。

使用 Ollama 安裝 Nemotron 3.5 Lightning

使用 Ollama 安裝、下載 Q4_0、開始對話並在完成後停止模型釋放記憶體的流程
完成本機對話後停止模型,才能明確釋放常駐記憶體。

安裝 Ollama

macOS 與 Windows 可以從 Ollama 官方下載頁 安裝 App。macOS 需要 Sonoma 14 以上,下載 DMG 後把 Ollama 拖進 Applications,再開啟一次;App 會檢查終端機能否找到 ollama 指令。Windows 安裝完成後會在背景執行,PowerShell、命令提示字元與 Windows Terminal 都能使用 CLI。

Linux 可以使用官方安裝腳本。安裝完成後先確認 CLI 與服務可以連線:

# Linux 安裝 Ollama
curl -fsSL https://ollama.com/install.sh | sh

# macOS、Windows 與 Linux 都能用這個指令確認安裝
ollama -v

# Linux 若沒有背景服務,可以在一個終端機啟動服務
ollama serve

更完整的 App、CLI、模型儲存位置與 API 操作可參考 Ollama 入門教學

下載並執行 Q4_0

本次測試使用 ggml-org 提供的 GGUF Q4_0。第一次執行時,Ollama 會從 Hugging Face 下載約 18.9GB 權重,完成後直接進入互動對話。開始前除了記憶體,也要確認模型磁碟有足夠空間:

# 第一次會下載約 18.9GB,之後直接載入既有檔案
ollama run hf.co/ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_0

# 進入互動模式後直接輸入問題
> 請用繁體中文整理這份需求,列出執行步驟

# 結束互動模式
> /bye

模型支援 thinking 開關,但不同 Ollama 版本與聊天介面的控制方式可能不同。本次速度數字是在 API 請求中關閉 thinking 後測得;若互動介面顯示推理內容,速度與輸出長度不宜直接套用本文數字。

查看占用與釋放記憶體

離開對話不一定會立刻把模型從記憶體移除。32GB 電腦若要接著執行其他高記憶體用量工作,可以查看常駐狀態,再明確停止模型:

# 查看模型是否仍在記憶體,以及實際占用
ollama ps

# 使用完畢後卸載模型,釋放記憶體
ollama stop hf.co/ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:Q4_0

Q4_0 是社群轉換的量化權重,不是 NVIDIA 官方模型卡主要驗證的 NVFP4 部署路徑。量化能大幅縮小檔案與記憶體需求,也可能帶來能力差異;本次數字只代表這個 Q4_0 檔案在指定 Mac 與 Ollama 版本下的表現。

BF16、NVFP4 與 GGUF 的用途

NVIDIA 同時提供不同精度與用途的權重。BF16 是完整精度的參考版本,適合後訓練、領域調整、蒸餾與製作其他量化格式;NVFP4 著重 NVIDIA 硬體上的推論效率;GGUF 則常用於 llama.cpp、Ollama 與 LM Studio 等本機工具。

版本主要用途
BF16研究、客製化與製作量化版本
NVFP4NVIDIA 硬體的高效率部署
GGUF Q4_0Ollama 等本機工具,檔案較小

這些版本不能只看檔案大小選擇。硬體是否支援對應計算路徑、推論引擎是否完整支援模型架構,以及需要多少 context,都會影響最後速度。對 Apple Silicon 使用者來說,GGUF 是目前較容易開始的方式;NVIDIA 官方部署則以 NVFP4 與 BF16 文件為主。

常見問答

Nemotron 3.5 Lightning 是開源模型嗎

較精確的分類是開放權重模型。NVIDIA 公開模型權重、部分訓練資料與方法,授權採 OpenMDW 1.1,官方模型卡標示可商業使用;但「開源」容易讓人聯想到軟體開源授權與完整重製條件,因此本文不把兩者直接畫上等號。

為什麼只有 3B 啟動,模型仍然需要約 19GB

3B active 指每個 token 參與運算的參數量,不是權重檔案只保存 3B。路由器每次可能選到不同專家,因此完整 30B 專家權重仍要保存在儲存裝置與記憶體中。

支援繁體中文嗎

NVIDIA 模型卡寫到預訓練涵蓋 20 種自然語言,後訓練的主要語言包含中文。本次速度測試也使用繁體中文提示詞並能正常生成。不過官方摘要沒有把中文列在主要支援語言清單,因此較適合先用自己的任務測試用詞、知識與長文穩定性,再決定是否投入正式工作。

可以直接使用 100 萬 token context 嗎

模型架構與官方伺服器部署方案支援最高 100 萬 token,但本機能開多少仍受記憶體、KV cache、推論引擎與量化版本限制。這次 Mac 實測只有 4096 context,沒有測量 100 萬 token 的速度與記憶體。

沒有適合的本機硬體,能在線上使用嗎

可以。NVIDIA Build 提供線上 Playground 與 OpenAI 相容 API,可先測試模型再決定是否部署。本機版本的優點是資料能留在自己的環境;線上 API 則省下下載權重與準備記憶體的工作,兩者的成本與資料處理方式並不相同。

參考來源


Sponsored Links