Ollama Cloud 改用 Token 計費,Pro 每月 20 美元包含 60 美元用量,Max 則以 100 美元包含 300 美元額度。三倍額度是否值得訂閱,取決於模型單價、快取命中與每月實際需求。本文整理 Free、Pro、Max、Team 的差異,試算 Pro 加購與 Max 的費用交叉點,說明台灣晚間使用 DeepSeek 的尖峰價格、舊戶保留方案與轉換條件,以及避免未用完額度浪費、Agent 重試增加支出的做法,協助判斷何時按量付費、何時升級。
Ollama Cloud 計費改版|20 美元含 60 美元額度,舊戶該換嗎?
Ollama 搭配 Codex 教學|本機模型能改程式嗎?Mac mini 實測
Ollama 能把本機模型接進 Codex,但連上服務、回答問題與完成改檔,是三種不同的成果。這篇以 Mac mini M4 32GB 的 Gemma 4 歷史實測,整理 Codex CLI 安裝、模型選擇、context 設定與原生 Responses API 連線方式,並交代 E4B 工具失敗、12B 最小任務成功、26B 改檔通過,以及 Pi 替代方案的限制。搭配工具分工、設定檢查、成果驗收圖解與終端機使用畫面,說明哪些小任務值得交給本機 Agent,哪些情況應先停止,避免把「完成了」誤當成可靠的程式成果。
NVIDIA Nemotron 3.5 Lightning 發表|30B 模型只有 3B 啟動,適合本機 AI 嗎?
NVIDIA 發表 Nemotron 3.5 Lightning 30B-A3B,採用 Mamba-2、MoE 與 Attention 混合架構,總參數量 30B,每次推論約啟動 3B,支援推理模式、工具呼叫與最高 100 萬 token context。本文說明 30B-A3B 的意思、開放權重與量化版本差異、Ollama 安裝方式,並在 Mac mini M4 32GB 實測 Q4_0 的載入時間、記憶體占用、prefill 與生成速度,評估它是否適合一般電腦執行本機 AI。
Meta Muse Glimmer 30B 發表|24GB 顯卡能跑,本機 AI Agent 開放權重
Meta 發布 Muse Glimmer 30B 開放權重模型,主打在 24GB、32GB 消費級硬體執行本機 AI Agent。本文整理 Muse Glimmer 與 Muse Spark、Llama 的關係,說明 131K context、圖片理解、工具呼叫、錯誤恢復與 DFlash 推測解碼,並提供 llama.cpp 下載和啟動教學,比較官方量化版本的記憶體需求、速度、benchmark、Apache 2.0 授權、安全限制,以及 Muse Spark 1.2 開放權重計畫。
Gemma4 12B 發布,比較 Gemma4 全系列能力|實測計概考試、程式作答、token 速度
Google 為 Gemma 4 開源家族補上 12B 中量級尺寸。這篇在 Mac mini M4 32GB 與 RTX 5070 Ti 兩種平台用 Ollama 實測 gemma4:12b,涵蓋 token 生成速度、計概 200 題單選題、以及實際寫 Python 解程式題三種跑分:選擇題逼近 26B,寫程式 70.2%、但難題仍吃力,dense 架構也讓 decode 墊底。文章拆解 26B MoE 與 31B dense 在 16GB 顯卡上的差異,整理 12B 的本地部署情境與顯卡記憶體選型。
MacBook Pro M2 Pro 跑 Gemma 4 實測|Apple Silicon 本地 LLM
在 MacBook Pro M2 Pro 16GB 上用 Ollama 跑 Gemma 4 到底有多快?跟 RTX 3070 8GB 相比誰贏?這篇把 Apple Silicon 統一記憶體架構放進本地 LLM 的實戰對比,從 TPS、TTFT、長 prompt 塞滿 128K context 一路測到 Ollama 對 e2b 偷偷開 thinking 的 bug 跨平台重現,並給出 num_ctx 跟真實 prompt 長度兩個容易被混淆的觀念說明,幫筆電族開發者找到本地 LLM 的實用上限。
Gemma 4 E2B vs E4B 完整實測|Thinking 模式的祕密與本地小模型最佳實踐
Gemma 4 的 E2B 和 E4B 兩個邊緣模型誰比較強?參數較小的 E2B 反而比 E4B 慢 10 倍是怎麼回事?這篇用 RTX 3070 跑了完整的 TPS、TTFT、品質對比 benchmark,並追到 Ollama renderer 層級找出 thinking 模式預設啟動的真相,順便整理本地小模型最佳實踐與 thinking、temperature、top_k、top_p 等參數說明。
本地跑 Claude Code 實戰|Ollama + Gemma 4 + RTX 3070 使用心得與踩坑筆記
想用本地 LLM 跑 Claude Code 省下雲端 API 費用?這篇分享在 Windows 11 + RTX 3070 8GB VRAM 上用 Ollama 接 Gemma 4 跑 Claude Code 的真實心得,包含安裝流程、Context length 設定、settings.json 被覆蓋的踩坑經驗、消費級顯卡的效能與使用限制,以及六種適合交給本地小模型處理的短任務與自動化用途。
Ollama 入門教學|本地大語言模型新手指南(Windows/Linux/macOS)
Ollama 能在 Windows、Linux 與 macOS 下載、執行和管理大語言模型,也能連接 Cloud 模型與其他 Agent 工具。本文從安裝和第一個本機模型開始,說明 App、CLI、模型標籤、參數量與量化,再整理 RAM、VRAM、context length 與 CPU/GPU offload 的關係。需要整合程式時,可參考 REST API、Python 與 Agent 用法;重視資料流向時,則可查閱本機、Cloud、網路工具與 local-only 設定的差異,依設備與需求選擇執行方式。
不用寫程式的機器學習,使用Xcode的Create ML訓練電腦分類文章-Text Classification以簡訊分類為例
Apple的Create ML讓開發者不需要了解太多機器學習的原理就可以訓練出自己的AI模型,輸出的模型可以用在各種蘋果平台上。本篇文章教學如何在Mac上使用Create ML訓練一個文字分類的AI模型,搭配Swift語言示範如何在App中使用你的模型。訓練階段你可以完全不寫程式碼就訓練好文字模型,還可以在Preview頁面中直接使用模型來分類更多文字,不會程式語言的朋友們也能體驗機器學習的魅力。