Ollama 是用來下載、執行與管理大語言模型的工具。安裝後可以在自己的 Windows、Linux 或 macOS 電腦執行模型,也能透過 App、終端機、REST API、Claude Code 與 Codex 使用。

Ollama 最初以本機模型為主,現在也加入 Cloud 模型、Web search 與 Agent 整合。因此「使用 Ollama」不一定代表所有資料都留在電腦內;選擇本機模型、Cloud 模型或網路工具時,資料流向並不相同。這篇會從安裝開始,把模型選擇、硬體需求、隱私設定與 Agent 用法一起整理。

Ollama 是什麼

Ollama 不是大語言模型,而是模型的執行引擎(runtime)。Gemma、Qwen、Llama、DeepSeek 與 gpt-oss 才是模型;Ollama 負責取得模型檔、套用 chat template、配置 CPU/GPU、保存模型及提供 API。

可以把它想成播放器:Ollama 是播放器,模型權重是影片檔。App、CLI 與其他程式都是操作播放器的入口;推論工作則可以在本機執行,也可以交給 Ollama Cloud。

App、CLI 與 API 透過 Ollama 執行引擎連接本機模型或 Cloud 模型
Ollama 負責執行與管理模型,不是模型本身。

Ollama 與 Llama 的差別

Ollama 是獨立的模型執行工具,Llama 是 Meta 開發的模型家族,兩者沒有隸屬關係。Ollama 能執行 Llama,也能執行其他公司與社群發布的模型,只是名稱看起來相近。



Sponsored Links

Windows、Linux 與 macOS 安裝

macOS 安裝

Ollama 官方建議下載 DMG,把 Ollama 拖進 Applications。macOS 版本需要 Sonoma 14 以上;Apple M 系列能使用 CPU 與 GPU,Intel Mac 只能使用 CPU。官方 App 會提供聊天介面,並把 ollama CLI 加進 PATH。下載位置在 Ollama for macOS

偏好 Homebrew 的話,可以只安裝 CLI 與服務,也可以安裝圖形 App。Homebrew 的基本操作可參考 macOS Homebrew 新手教學

# 安裝 CLI 版本
brew install ollama

# 啟動前景服務,Control + C 可以停止
ollama serve

# 或交給 Homebrew 在背景執行
brew services start ollama
brew services stop ollama

# 安裝包含聊天介面的 App
brew install --cask ollama-app

Linux 安裝

Linux 可以使用 官方安裝腳本。腳本會依架構安裝 Ollama,並在支援 systemd 的環境建立服務:

# 安裝或更新 Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 查看服務狀態
sudo systemctl status ollama

# 啟動、停止與設定開機啟動
sudo systemctl start ollama
sudo systemctl stop ollama
sudo systemctl enable ollama

NVIDIA 顯卡先用 nvidia-smi 確認驅動;AMD GPU 則需要相容的 ROCm 驅動。只有 CPU 也能執行,但大型模型的生成速度通常較慢。

Windows 安裝

Windows 版本支援 Windows 10 22H2 以上,安裝後 Ollama 會在背景執行,API 位址同樣是 http://localhost:11434。可以下載 OllamaSetup.exe,或在 PowerShell 執行:

# 在 PowerShell 安裝 Ollama
irm https://ollama.com/install.ps1 | iex

# 確認 CLI 可以使用
ollama --version

執行第一個本機模型

Ollama 服務啟動後,先用 Gemma 3 4B 測試。預設量化檔約 3.3GB,適合確認安裝、GPU 與中文輸出是否正常:

# 下載模型,可以省略這一步讓 run 自動下載
ollama pull gemma3:4b

# 進入互動聊天
ollama run gemma3:4b

看到 >>> 後就能直接輸入問題。/? 會列出互動指令,/bye 則離開聊天。模型可能輸出 Markdown 標記,CLI 會以純文字顯示;App 與網頁聊天介面通常會把 Markdown 渲染成標題、清單和連結。

App 聊天、PDF 與圖片

macOS 與 Windows 的 Ollama App 可以直接下載模型和聊天,也能拖入文字檔、PDF、程式碼及圖片。不過,圖片輸入需要模型本身具備 vision 能力,例如 Gemma 3 的 4B、12B、27B;270M 與 1B 版本只有文字輸入。處理大型文件時提高 context 會增加記憶體需求。

# 在 CLI 將圖片路徑交給支援 vision 的模型
ollama run gemma3:4b "請說明這張圖片的內容:/path/to/image.png"

模型下載、標籤與管理指令

模型可以從 Ollama 模型庫 搜尋。模型頁會列出參數量、檔案大小、量化格式、context 與輸入類型,下載前先確認標籤,比只看模型名稱可靠。

# 下載或更新指定模型
ollama pull gemma3:4b

# 列出已安裝模型
ollama ls

# 查看模型架構、參數量、量化與 context
ollama show gemma3:4b

# 查看正在記憶體內的模型、CPU/GPU 比例與 context
ollama ps

# 將指定模型移出記憶體
ollama stop gemma3:4b

# 刪除磁碟裡的模型
ollama rm gemma3:4b

latest 與模型標籤

沒有指定標籤時,Ollama 會使用模型頁設定的 latest。例如目前 gemma3gemma3:latestgemma3:4b 指向相同版本,但這不是通用規則,而且維護者之後可以調整 latest。正式環境建議寫出參數大小與量化標籤,避免更新後模型突然改變。

參數量與量化

參數量是模型的權重數量,4B 代表約 40 億參數。較大模型通常能容納更多知識與能力,但實際效果還會受架構、訓練資料與後訓練影響,不能只用 B 數判斷。

量化會用較少位元保存權重,例如常見的 Q4_K_MQ8_0。低位元版本占用較少磁碟與記憶體,代價是品質可能下降。一般本機使用可先從官方預設的 Q4 版本開始,確認速度和品質後再比較其他量化。

開源與開放權重

Ollama 程式本身採用 MIT License,是開源軟體;透過 Ollama 下載的模型則各有授權。許多模型只公開已訓練完成的權重,沒有公開完整訓練資料與流程,較精確的名稱是開放權重模型。能下載模型不等於可以任意商用,部署前仍要查看模型頁的 license。

RAM、VRAM 與 context length

模型頁顯示的檔案大小只是權重,不是執行時的完整記憶體需求。Ollama 還要配置 KV cache、context、推論引擎與暫存空間。模型檔能載入,不代表把 context 開到模型上限後仍能全部放進 GPU。

RAM 與 VRAM 需要容納模型權重、KV cache 和執行空間,Context 增加也會提高記憶體需求
模型權重只是記憶體需求的一部分。

目前 Ollama 會依 VRAM 選擇預設 context:低於 24GiB 是 4K、24–48GiB 是 32K、48GiB 以上是 256K。這是 Ollama 的配置,不是模型本身的最大 context。網頁搜尋、程式開發與 Agent 工作通常需要更長內容,官方建議至少 64K,但提高 context 會增加 KV cache 與記憶體占用。

# 將 Ollama 服務的 context 設為 64K
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

# 檢查模型實際使用的 CPU/GPU 比例與 context
ollama ps

ollama psPROCESSOR 欄位如果顯示 100% GPU,代表模型全部放進 GPU;CPU/GPU 混合表示部分資料被 offload 到系統記憶體。混合執行可以讓容量較小的顯卡載入模型,但速度通常會下降。記憶體不足時,先換較小量化、降低 context、減少平行請求,再考慮改用小模型或 Cloud 模型。

本機模型與 Ollama Cloud

本機模型在自己的電腦推論,不需要 Ollama 帳號,Ollama 官方表示不會看到本機執行的 prompt 與資料。Cloud 模型則把 prompt 和回覆送到 Ollama 的伺服器處理,適合執行個人硬體放不下的大模型。官方表示 Cloud 服務不儲存或記錄 prompt 與回覆,也不拿來訓練,但資料仍會離開本機。

# 登入 Ollama 帳號後使用 Cloud 模型
ollama signin
ollama run gpt-oss:120b-cloud

# 暫時關閉 Cloud 與 Web search 功能
OLLAMA_NO_CLOUD=1 ollama serve

需要長期 local-only,可以在 ~/.ollama/server.json 設定:

{
  "disable_ollama_cloud": true
}

重新啟動 Ollama 後,Cloud 模型與 Web search 都會停用。即使使用本機模型,Agent 連接的瀏覽器、MCP、外部 API 與其他工具仍可能傳送資料,不能只靠模型位置判斷整個工作流程是否離線。

Claude Code、Codex 與 Agent 整合

新版 Ollama 提供 ollama launch,能設定 Claude Code、Codex、OpenCode、VS Code 等工具使用本機或 Cloud 模型。Ollama 處理模型推論,Agent 本身負責讀取專案、執行指令與要求操作權限,兩層不要混在一起。

Claude Code 與 Codex 經過權限確認存取專案檔案和工具,並透過 Ollama 使用本機或 Cloud 模型
Agent 權限與模型推論是兩個不同層次。
# 互動選擇整合工具與模型
ollama launch

# 直接啟動 Claude Code
ollama launch claude

# 指定 Claude Code 使用某個 Ollama 模型
ollama launch claude --model qwen3.5

# 啟動 Codex CLI
ollama launch codex

# 只寫入設定,不立即啟動
ollama launch codex --config

Claude Code 與 Codex 都需要較長 context,Ollama 官方建議至少 64K。這通常比一般聊天耗用更多記憶體;如果 ollama ps 顯示大量 offload 到 CPU,Agent 讀取 repository、執行工具與等待模型的速度可能不理想。24GB 以下硬體可以先從小型 coding 模型、較短任務或 Cloud 模型開始。

REST API 與 Python 範例

只有要把 Ollama 接進自製程式時才需要這一節。App、Claude Code 與 Codex 使用者不必自己組 API request。Ollama 原生 API 預設位於 http://localhost:11434/api/chat 用於多輪訊息,/api/generate 適合單次 prompt。

curl http://localhost:11434/api/chat \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma3:4b",
    "messages": [
      {"role": "user", "content": "請用三句話介紹台北 101"}
    ],
    "stream": false
  }'

Python requests

使用 requests 呼叫原生 API 時,不必先執行 ollama run;只要 Ollama 服務正在運作,API 會自行載入指定模型。

import requests

payload = {
    "model": "gemma3:4b",
    "messages": [
        {"role": "system", "content": "請用繁體中文回答。"},
        {"role": "user", "content": "Ollama 和 Llama 有什麼差別?"},
    ],
    "stream": False,
}

response = requests.post(
    "http://localhost:11434/api/chat",
    json=payload,
    timeout=120,
)
response.raise_for_status()
print(response.json()["message"]["content"])

回應中的 total_durationload_durationprompt_eval_counteval_count 可以用來觀察載入時間及輸入、輸出 token。Ollama 另外提供 OpenAI-compatible API 與 Anthropic-compatible API,方便現有 SDK 和工具改接本機位址,但支援欄位不一定和官方雲端 API 完全相同。

常見問答

Ollama 免費嗎?

Ollama 程式與本機推論不收 token 費用,但仍有硬體、電力和維護成本;每個模型也有自己的授權。Cloud 模型需要 Ollama 帳號,方案、額度與價格以當時官方頁面為準。

沒有獨立顯卡可以執行嗎?

可以使用 CPU 與系統記憶體,只是速度通常比 GPU 慢。Apple Silicon 使用 Unified Memory,CPU 與 GPU 共用同一組記憶體。硬體有限時先選 1B、4B 等小模型與 Q4 量化,並降低 context。

如何確認模型有沒有使用 GPU?

模型執行期間輸入 ollama ps,查看 PROCESSOR 欄位。100% GPU 代表全部使用 GPU,100% CPU 代表放在系統記憶體,CPU/GPU 混合則表示只有部分模型卸載到 GPU。

Ollama 可以完全離線嗎?

模型與程式下載完成後,本機模型可以離線推論。若要明確停用 Cloud 與 Web search,可設定 disable_ollama_cloudOLLAMA_NO_CLOUD=1。Agent 使用的外部工具仍要分開檢查。

模型檔案放在哪裡?

macOS 預設放在 ~/.ollama/models,Linux 官方安裝版放在 /usr/share/ollama/.ollama/models,Windows 則位於使用者目錄的 .ollama\models。磁碟空間不足時可以用 OLLAMA_MODELS 環境變數指定其他位置,修改後要重新啟動 Ollama。

Ollama 如何更新?

macOS 與 Windows App 會自動下載更新,從選單重新啟動即可套用;Homebrew 使用 brew upgrade ollama,Linux 則重新執行官方安裝腳本。模型更新和 Ollama 程式更新是兩件事,模型要另外執行 ollama pull 模型名稱

Ollama 可以生成圖片嗎?

Ollama 已提供實驗性的本機圖片生成,本文更新時先支援 macOS,Windows 與 Linux 仍在規劃中。這和 Gemma 3 等 vision 模型的「理解圖片」不同,必須使用 Z-Image Turbo、FLUX.2 Klein 等圖片生成模型。

參考來源


Sponsored Links