Ollama 在 2026 年 8 月 31 日調整 Cloud 計費:Pro 每月付 20 美元,包含按模型單價計算的 60 美元用量。不過,只用到 10 美元的人不一定需要訂閱,用超過 60 美元的人也不必立刻升 Max。選方案時,應該比較完成工作後的總支出,而不是額度看起來有多大。
這次改版讓雲端用量比較容易換算成費用,也改變了長時間使用 Agent 的支出方式。以下依 2026 年 9 月 7 日的官方資料,拆解新制價格、台灣尖峰時段與舊戶選擇;費用範例是依公開價格推算,不是模型性能實測。
Ollama Cloud 是什麼
Ollama 是用來下載、執行與管理開放模型的工具,Ollama Cloud 則是同一家公司提供的雲端推論服務。原本需要放進電腦記憶體或顯示卡的模型,改由遠端伺服器執行,讓硬體裝不下大模型的使用者,也能透過既有 App、CLI 或 API 使用。 官方 Cloud 文件 有說明本機工具與雲端模型的連接方式。
因此,這次調整的是 Cloud 用量計費,本機執行模型仍不收 token 費用。使用本機模型要負擔硬體、電力與維護;使用 Cloud 則把推論交給 Ollama,費用與資料流向都不同。安裝、模型管理及 local-only 設定可參考 Ollama 入門教學 。
對以本機小模型處理日常工作、偶爾需要大模型的人,Cloud 可以是補充算力的方式。這種用途不一定每個月都需要固定訂閱,付費頻率應該跟工作需求一起考慮。
Ollama Cloud 新制價格與用量限制
新制把模型消耗的 token 換算成美元,先扣方案內含額度,再扣額外加購的用量。下表依 官方價格頁 整理;「包含用量」是可抵扣的服務額度,不能當成現金回饋。
| 方案 | 月繳費用 | 每月包含用量 | 同時請求上限 |
|---|---|---|---|
| Free | 0 美元 | 部分入門模型的每月起始額度,未公布固定金額;可加購 | 1 |
| Pro | 20 美元 (約新台幣 630 元) | 60 美元 (約新台幣 1,900 元) | 3 |
| Max | 100 美元 (約新台幣 3,170 元) | 300 美元 (約新台幣 9,500 元) | 10 |
| Team | 500 美元 (約新台幣 15,840 元) | 全隊共享 1,000 美元 (約新台幣 31,680 元) | 10 |
換算採 臺灣銀行 2026 年 9 月 4 日收盤牌告 的美元即期賣出價 31.68,僅供估算,實際刷卡仍受匯率、稅費與手續費影響。Pro 另有年繳 200 美元方案,但每月額度仍按月更新。
內含額度到訂閱週期日重設,未用完不會累積到下個月。新制取消舊有 5 小時與每週用量限制,但仍有表中的並行上限。這代表可以把較多工作集中在某一天完成,並不代表固定月費可以無限使用。

Team 的價值在共享與管理
Team 目前採導入期價格,不限制使用者人數,適合需要共同管理帳單與用量的團隊。不過,人數不設上限,並不會讓每人各獲得一份完整額度。評估時應把團隊每月總用量、成員間忙閒差異,以及集中管理的需求一起算進去。若只是兩三人偶爾使用,不能只憑「不限人數」就判定 Team 比個人方案便宜。
60 美元額度能用多久
60 美元沒有固定對應的對話次數。Token 是模型處理文字等內容的計量單位,不等於中文字數;每次請求的輸入長度、輸出長度、模型單價與快取命中,都會改變消耗。使用 Agent 時,應把同一任務內的多次模型請求加總。
相同 Token 數量,模型費用可能差很多
以下選 DeepSeek V4 Flash 與 Kimi K3 示範。表內單價為每百萬 token 的美元價格;最後一欄假設一段期間共使用 1,000 萬個未命中快取的輸入 token,加上 100 萬個輸出 token。
| 模型/時段 | 輸入 | 快取輸入 | 輸出 | 範例用量價值 |
|---|---|---|---|---|
| DeepSeek V4 Flash,一般時段 | 0.22 | 0.007 | 0.66 | 2.86 美元 |
| DeepSeek V4 Flash,尖峰時段 | 0.44 | 0.014 | 1.32 | 5.72 美元 |
| Kimi K3 | 3.00 | 0.30 | 15.00 | 45.00 美元 |
例如一般時段的 DeepSeek V4 Flash 為 10 × 0.22 + 1 × 0.66 = 2.86 美元。這些金額是從用量池扣除的價值,不是另外加在月費上的固定費用;若仍有內含額度,就先抵扣。
這張表比較的是同樣 token 數量的成本,不是完成同一工作的成本。較便宜的模型如果需要多次重試,省下的單價可能被額外請求抵銷;較貴的模型若能減少修改輪次,也可能適合某些工作。選擇時可以記錄「完成一項可驗收任務花了多少」,不必只追求每百萬 token 的低價。
台灣晚間會遇到 DeepSeek 尖峰價格
目前價格頁對 DeepSeek V4 Flash 與 V4 Pro 列出尖峰費率,時間為週一至週五 12:00–18:00 UTC。換成台灣時間,是週一至週五晚上 20:00 開始,各次到翌日凌晨 02:00 結束,因此也包含週六凌晨。兩個模型列出的尖峰輸入、快取輸入與輸出單價都是一般時段的兩倍,不能把這條規則套到所有 Cloud 模型。

對下班後才集中開發的人,應直接用尖峰費率估算預算;可以延後的批次整理、文件摘要,再考慮放到非尖峰時段。若為省幾美元而拖延急件,則未必值得,這是工作時效與推論費用之間的取捨。
快取命中對費用的影響
以上述 Kimi K3 範例來說,如果 1,000 萬輸入 token 中有 800 萬實際命中快取,剩下 200 萬按一般輸入收費,費用就是 2 × 3 + 8 × 0.30 + 1 × 15 = 23.40 美元。這是條件式試算,不能因為對話接續同一專案,就把全部輸入都當成快取價。用帳號中的實際用量紀錄估算,才有辦法判斷 60 美元是否足夠。
Pro 用完加購,何時比 Max 便宜
以月繳方案、相同模型與相同工作量計算,每月用量價值超過 140 美元,Max 的費用才開始低於 Pro 加購。這是依公開定價推導的交叉點,前提是不需要為了更多並行請求或其他功能提早升級,也不計稅費、匯差與方案轉換當月的帳務調整。

令 U 代表按模型單價加總的每月用量價值,並非月費。Pro 的估算支出是 20 + max(0, U − 60),Max 則是 100 + max(0, U − 300)。例如 U 為 100 時,Pro 支付月費 20,加購 40,合計 60 美元;直接訂 Max 則要 100 美元。
| 每月用量價值 U | Pro 月繳+加購 | Max 月繳+加購 |
|---|---|---|
| 40 美元 | 20 美元 | 100 美元 |
| 60 美元 | 20 美元 | 100 美元 |
| 100 美元 | 60 美元 | 100 美元 |
| 140 美元 | 100 美元 | 100 美元 |
| 200 美元 | 160 美元 | 100 美元 |
| 300 美元 | 260 美元 | 100 美元 |
| 400 美元 | 360 美元 | 200 美元 |
140 的由來是 20 + (U − 60) = 100。它也說明「Pro 的 60 美元快用完」不足以構成升級理由。若每月用量穩定落在 80–120 美元,保留 Pro 並按需加購,單看推論支出仍較低。
按量付費與 Pro 的費用分界
若每月只需要約 10 美元用量,直接加購就比付 20 美元月費少。忽略 Free 的入門贈額時,按量付費與月繳 Pro 約在每月 20 美元用量相等;超過這個量後,Pro 的內含額度開始有費用優勢。免費贈額的金額與適用模型未完整公開,因此這個 20 美元只能作為初步判斷,不能保證每個帳號的實際分界都相同。
只在專案收尾或假日需要大模型的人,可以先記錄一個完整月份的需求。固定訂閱會在沒工作的月份繼續支出,未用掉的額度也不會補到下次忙碌時使用。
年繳與並行需求的影響
Pro 年繳 200 美元,平均每月約 16.67 美元,但需要一次承諾一年的費用。假設每月需求穩定,將年費平均攤提後,與月繳 Max 的交叉點約為每月 143.33 美元用量;這不是每月實際扣款方式。只需要幾個月的專案,不宜單看平均月費就選年繳。
費用也不是唯一條件。需要同時發出四個以上模型請求時,Pro 的三個並行額度可能讓工作排隊,即使用量還不到 140 美元,也可能有升級 Max 的理由。此時多付的是工作排程的彈性,應觀察等待時間是否影響交付,而不是把更高方案當成模型品質升級。
Ollama 舊訂閱用戶該不該換
舊方案仍能滿足工作需求時,建議先保留,估算新制支出後再換。官方這次解決的是 GPU-time 用量難預測的問題,但沒有提供能把每個人的舊額度直接換成新 token 額度的固定比例。因此,不能只憑「三倍額度」判定新制對舊戶一定降價。
依 改版公告的舊戶說明 ,持續自動續訂可保留原計費模式;改變月繳/年繳週期或訂閱等級,則會轉入新制。轉換後會立即取得新方案的整份當月用量,原重設日維持不變。
例如,原本想把月繳 Pro 改成年繳來省月費,應先確認這個操作同時會改變用量計價。若舊方案的日常可用量足夠,為了年費折扣轉換,可能失去原本適合的使用方式;若經常因 5 小時或每週限制打斷工作,新制則比較適合把任務集中完成,但要接受超出內含額度後的額外支出。
已轉換後想回復的人,官方目前提供的條件是:改版當時已有有效訂閱,可聯絡客服恢復原等級與原繳費週期。這是有資格條件的人工處理,不宜當成所有帳號都能隨時來回切換的保證。
Agent 使用者如何控制 Cloud 支出
使用現成 Agent 或自行呼叫 API,都可以先把支出紀錄對應到工作成果。比起每天只看剩餘百分比,以下做法更能判斷費用增加的原因。
- 記錄任務前後的用量差。在 帳號用量頁 查看紀錄,把模型、是否完成、重試次數與消耗一起留下。若同類工作愈來愈貴,先檢查輸入是否變長、是否反覆修正,以及使用時段。
- 讓升級跟完整月份的需求走。偶發超量先比較加購;經常超過費用交叉點,或並行限制影響工作,再考慮提高方案。月底剩很多額度時,也沒有必要為了用完而追加無需求的工作。
- 給 Agent 明確的停止條件。在任務需求裡寫出驗收項目與可接受的重試範圍,避免已完成後又擴大檢查。若更換模型,另外核對是否仍能完成同級任務,不能把低單價直接當成總成本下降。
- 區分提醒與預算上限。付費方案在內含額度使用到 90% 時預設會寄提醒,可在設定中關閉;提醒本身不會停止扣額度。Team 的價格說明另提供固定加值及關閉自動用量計費的方式;個人方案可用的控制項,應以帳號設定實際提供的選項為準。
對工作量穩定的使用者,新制的價值是能用公開單價預估支出,再依任務調整模型與時段。對用量少或波動大的人,按需加購、保留舊方案,或繼續以本機模型處理合適的工作,都是可以成立的選擇。
常見問答
選擇方案之外,還需要分清楚額度、執行位置與服務限制。
Ollama 改版後,本機模型也要付費嗎?
本機推論不會扣 Cloud 用量。是否收費取決於請求交給本機模型或 Cloud,而不是電腦上有沒有安裝 Ollama。仍需自行負擔硬體與電力,並遵守所用模型的授權。
Cloud 的零資料保留等於資料不離開電腦嗎?
不是。Cloud 需要把推論內容送到遠端處理;Ollama 的零資料保留與不訓練承諾,描述的是遠端如何處理資料。 Ollama FAQ 另有本機與 Cloud 的隱私說明。需要離線處理時,應使用本機模型,也要確認 Agent 的外部工具是否另行傳送資料。
Pro 含三倍額度,代表所有用量都打三三折嗎?
只有把每月 60 美元額度用滿時,20 美元月費相對這份用量約為三分之一;用量較少,比例就不同。用超過內含額度的部分按公布單價加購,因此不能把同一折扣套到整個月的所有 token。
參考來源
- Ollama: Ollama’s transparent pricing (新計費與舊戶轉換)
- Ollama: Pricing (方案與模型價格)
- Ollama: Cloud (雲端模型與使用方式)
- Ollama: FAQ (本機執行與資料隱私)
- Ollama: deepseek-v4-flash (DeepSeek V4 Flash 模型與單價)
- Ollama: kimi-k3 (Kimi K3 模型與單價)
- Bank of Taiwan: Historical Foreign Exchange Rate – Closing Rate (美元匯率換算參考)