Ollama Cloud 計費改版|20 美元含 60 美元額度,舊戶該換嗎?

Ollama Cloud 改用 Token 計費,Pro 每月 20 美元包含 60 美元用量,Max 則以 100 美元包含 300 美元額度。三倍額度是否值得訂閱,取決於模型單價、快取命中與每月實際需求。本文整理 Free、Pro、Max、Team 的差異,試算 Pro 加購與 Max 的費用交叉點,說明台灣晚間使用 DeepSeek 的尖峰價格、舊戶保留方案與轉換條件,以及避免未用完額度浪費、Agent 重試增加支出的做法,協助判斷何時按量付費、何時升級。

Ollama 搭配 Codex 教學|本機模型能改程式嗎?Mac mini 實測

Ollama 能把本機模型接進 Codex,但連上服務、回答問題與完成改檔,是三種不同的成果。這篇以 Mac mini M4 32GB 的 Gemma 4 歷史實測,整理 Codex CLI 安裝、模型選擇、context 設定與原生 Responses API 連線方式,並交代 E4B 工具失敗、12B 最小任務成功、26B 改檔通過,以及 Pi 替代方案的限制。搭配工具分工、設定檢查、成果驗收圖解與終端機使用畫面,說明哪些小任務值得交給本機 Agent,哪些情況應先停止,避免把「完成了」誤當成可靠的程式成果。

NVIDIA Nemotron 3.5 Lightning 發表|30B 模型只有 3B 啟動,適合本機 AI 嗎?

NVIDIA 發表 Nemotron 3.5 Lightning 30B-A3B,採用 Mamba-2、MoE 與 Attention 混合架構,總參數量 30B,每次推論約啟動 3B,支援推理模式、工具呼叫與最高 100 萬 token context。本文說明 30B-A3B 的意思、開放權重與量化版本差異、Ollama 安裝方式,並在 Mac mini M4 32GB 實測 Q4_0 的載入時間、記憶體占用、prefill 與生成速度,評估它是否適合一般電腦執行本機 AI。

Meta Muse Glimmer 30B 發表|24GB 顯卡能跑,本機 AI Agent 開放權重

Meta 發布 Muse Glimmer 30B 開放權重模型,主打在 24GB、32GB 消費級硬體執行本機 AI Agent。本文整理 Muse Glimmer 與 Muse Spark、Llama 的關係,說明 131K context、圖片理解、工具呼叫、錯誤恢復與 DFlash 推測解碼,並提供 llama.cpp 下載和啟動教學,比較官方量化版本的記憶體需求、速度、benchmark、Apache 2.0 授權、安全限制,以及 Muse Spark 1.2 開放權重計畫。

Gemma4 12B 發布,比較 Gemma4 全系列能力|實測計概考試、程式作答、token 速度

Google 為 Gemma 4 開源家族補上 12B 中量級尺寸。這篇在 Mac mini M4 32GB 與 RTX 5070 Ti 兩種平台用 Ollama 實測 gemma4:12b,涵蓋 token 生成速度、計概 200 題單選題、以及實際寫 Python 解程式題三種跑分:選擇題逼近 26B,寫程式 70.2%、但難題仍吃力,dense 架構也讓 decode 墊底。文章拆解 26B MoE 與 31B dense 在 16GB 顯卡上的差異,整理 12B 的本地部署情境與顯卡記憶體選型。

MacBook Pro M2 Pro 跑 Gemma 4 實測|Apple Silicon 本地 LLM

在 MacBook Pro M2 Pro 16GB 上用 Ollama 跑 Gemma 4 到底有多快?跟 RTX 3070 8GB 相比誰贏?這篇把 Apple Silicon 統一記憶體架構放進本地 LLM 的實戰對比,從 TPS、TTFT、長 prompt 塞滿 128K context 一路測到 Ollama 對 e2b 偷偷開 thinking 的 bug 跨平台重現,並給出 num_ctx 跟真實 prompt 長度兩個容易被混淆的觀念說明,幫筆電族開發者找到本地 LLM 的實用上限。

Gemma 4 E2B vs E4B 完整實測|Thinking 模式的祕密與本地小模型最佳實踐

Gemma 4 的 E2B 和 E4B 兩個邊緣模型誰比較強?參數較小的 E2B 反而比 E4B 慢 10 倍是怎麼回事?這篇用 RTX 3070 跑了完整的 TPS、TTFT、品質對比 benchmark,並追到 Ollama renderer 層級找出 thinking 模式預設啟動的真相,順便整理本地小模型最佳實踐與 thinking、temperature、top_k、top_p 等參數說明。

本地跑 Claude Code 實戰|Ollama + Gemma 4 + RTX 3070 使用心得與踩坑筆記

想用本地 LLM 跑 Claude Code 省下雲端 API 費用?這篇分享在 Windows 11 + RTX 3070 8GB VRAM 上用 Ollama 接 Gemma 4 跑 Claude Code 的真實心得,包含安裝流程、Context length 設定、settings.json 被覆蓋的踩坑經驗、消費級顯卡的效能與使用限制,以及六種適合交給本地小模型處理的短任務與自動化用途。

Ollama 入門教學|本地大語言模型新手指南(Windows/Linux/macOS)

Ollama 能在 Windows、Linux 與 macOS 下載、執行和管理大語言模型,也能連接 Cloud 模型與其他 Agent 工具。本文從安裝和第一個本機模型開始,說明 App、CLI、模型標籤、參數量與量化,再整理 RAM、VRAM、context length 與 CPU/GPU offload 的關係。需要整合程式時,可參考 REST API、Python 與 Agent 用法;重視資料流向時,則可查閱本機、Cloud、網路工具與 local-only 設定的差異,依設備與需求選擇執行方式。

不用寫程式的機器學習,使用Xcode的Create ML訓練電腦分類文章-Text Classification以簡訊分類為例

Apple的Create ML讓開發者不需要了解太多機器學習的原理就可以訓練出自己的AI模型,輸出的模型可以用在各種蘋果平台上。本篇文章教學如何在Mac上使用Create ML訓練一個文字分類的AI模型,搭配Swift語言示範如何在App中使用你的模型。訓練階段你可以完全不寫程式碼就訓練好文字模型,還可以在Preview頁面中直接使用模型來分類更多文字,不會程式語言的朋友們也能體驗機器學習的魅力。