Gemma4 12B 發布,比較 Gemma4 全系列能力|實測計概考試、程式作答、token 速度

Google 為 Gemma 4 開源家族補上 12B 中量級尺寸。這篇在 Mac mini M4 32GB 與 RTX 5070 Ti 兩種平台用 Ollama 實測 gemma4:12b,涵蓋 token 生成速度、計概 200 題單選題、以及實際寫 Python 解程式題三種跑分:選擇題逼近 26B,寫程式 70.2%、但難題仍吃力,dense 架構也讓 decode 墊底。文章拆解 26B MoE 與 31B dense 在 16GB 顯卡上的差異,整理 12B 的本地部署情境與顯卡記憶體選型。

Gemma 4 E2B vs E4B 完整實測|Thinking 模式的祕密與本地小模型最佳實踐

Gemma 4 的 E2B 和 E4B 兩個邊緣模型誰比較強?參數較小的 E2B 反而比 E4B 慢 10 倍是怎麼回事?這篇用 RTX 3070 跑了完整的 TPS、TTFT、品質對比 benchmark,並追到 Ollama renderer 層級找出 thinking 模式預設啟動的真相,順便整理本地小模型最佳實踐與 thinking、temperature、top_k、top_p 等參數說明。

Google Gemma 4|多模態開源模型大更新,手機 1.5GB 就能跑、電腦端效能翻倍再翻倍

Google DeepMind 發佈 Gemma 4 開源模型家族,採用 Apache 2.0 授權,提供 31B Dense、26B MoE、E4B、E2B 四種尺寸。31B 在 Arena AI 排名開源模型第三,26B MoE 只用 3.8B 參數就達到接近表現。支援圖片、影片、語音多模態輸入,原生 function calling 與 agent 工作流,E2B 僅需 1.5GB 記憶體就能在手機和 Raspberry Pi 上跑。

Ollama 入門教學|本地大語言模型新手指南(Windows/Linux/macOS)

Ollama 能在 Windows、Linux 與 macOS 執行和管理本機大語言模型,也能連接 Cloud 模型、Claude Code、Codex、OpenCode 與 REST API。本文從安裝、下載模型、App 與 CLI 操作開始,說明參數量、量化、RAM/VRAM、context length 與 CPU/GPU offload,再示範 Python API、模型管理、local-only 隱私設定及 Agent 整合方式。