Ollama 是一款用來在個人電腦或伺服器上下載、執行開源大型語言模型的工具。它把模型下載、量化推論與 API 服務封裝成一條指令(例如 ollama run qwen3.6),讓 Qwen、DeepSeek、GLM、Gemma、Kimi 等開放權重模型能像一般軟體一樣在本機跑起來,並透過本機連接埠對任何應用提供 OpenAI 相容介面。本機執行完全免費、不需註冊;官方同時經營按 token 計費的雲端模型服務,帳號與雲端功能皆為選配。專案程式碼以 MIT 授權開源,截至 2026-10-02 在 GitHub 上累積約 18.2 萬 stars,是目前本機大模型工具中使用最廣的專案之一。

Ollama 官網首頁,提供 macOS、Windows、Linux 版本下載

站點速覽

  • 網址:https://ollama.com
  • 類型:本機大模型執行工具/開源開發者工具(MIT 授權)
  • 費用:本機執行免費不限量;雲端模型按 token 計費,分 Free/Pro/Max/Team/Enterprise 檔
  • 註冊要求:本機使用無需註冊;僅雲端模型需要帳號與 API Key
  • 介面形態:官方桌面應用(macOS/Windows)+命令列+本機 REST API;網站與文件為英文
  • 平台:macOS 14+、Windows 10 22H2+、Linux、Docker

站點背景

Ollama 的 GitHub 儲存庫建立於 2023 年 6 月,由 Ollama Inc. 維護,以 MIT 授權開源。截至 2026-10-02,儲存庫約 18.2 萬 stars、1.8 萬 forks,最新版本為 2026-09-28 發布的 v0.35.0,當日仍有提交紀錄,維護狀態活躍。

Ollama GitHub 儲存庫首頁,顯示 MIT 授權與 star 數

根據官方部落格 2026 年 7 月的公告,Ollama 當時服務約 890 萬名開發者,並完成 8,800 萬美元融資,投資方包括 Benchmark、Theory Ventures、8VC、Y Combinator 等。其推論後端早期基於 llama.cpp,2026 年中起在 Apple Silicon 裝置上新增 MLX 引擎,官方稱在程式代理(coding agent)場景下配合多 token 預測可將 Gemma 4 的速度提升最高約 90%(官方部落格,2026-06)。

核心能力

一條指令執行模型。安裝後執行 ollama run <模型名> 即自動拉取並進入對話;ollama pull、ollama ps、ollama rm 分別負責下載、查看載入狀態(含 GPU/CPU 佔比)與刪除模型。

本機 OpenAI 相容 API。Ollama 在 http://localhost:11434 提供 REST API,並實作了 OpenAI 的 Chat Completions 與 Responses 介面以及 Anthropic Messages 相容層,現有使用 OpenAI SDK 的應用只需修改 base_url 即可切換到本機模型;官方另提供 Python 與 JavaScript 的 SDK。

Modelfile 自訂模型。透過 Modelfile 可以基於既有模型定義系統提示詞、取樣參數、對話模板等,再以 ollama create 建構成自己的模型版本,也能匯入 GGUF 等格式的權重。

串接程式代理與桌面應用。ollama launch claude、ollama launch codex、ollama launch opencode 等指令可將 Claude Code、Codex CLI、OpenCode、OpenClaw 等程式代理直接接到 Ollama 模型上;macOS/Windows 桌面應用內可將 Claude Desktop、ChatGPT Desktop(Codex 模式)設定為使用 Ollama 模型。README 維護了龐大的社群整合清單,涵蓋 Open WebUI、Continue、LangChain、LlamaIndex、Dify 等常見框架與介面。

安裝與平台要求

  • macOS:需 macOS Sonoma(14)或更新;Apple M 系列晶片支援 CPU+GPU 加速,Intel 機型僅支援 CPU 推論。
  • Windows:需 Windows 10 22H2 或更新(Home/Pro);NVIDIA 顯示卡需 551.61 或更新驅動;可透過 irm https://ollama.com/install.ps1 | iex 或安裝包安裝。
  • Linux:執行 curl -fsSL https://ollama.com/install.sh | sh,以 systemd 服務運作,無官方圖形介面。
  • Docker:官方映像 ollama/ollama 發布於 Docker Hub。

需留意模型檔案的磁碟佔用:官方文件提醒模型體積可達數十至數百 GB,家目錄空間不足時需調整儲存位置。

模型生態與雲端服務

Ollama 的模型庫依熱度與更新時間排序,條目帶有 vision(視覺)、tools(工具呼叫)、thinking(推理)、embedding、decision、cloud 等能力標籤,並標註參數規模、上下文長度與累計拉取次數。截至 2026-10-02,熱門模型包括 qwen3.6(約 690 萬次拉取)、qwen3.8(約 300 萬次)、glm-5.3-flash、deepseek-v4.1-flash 等。

Ollama 模型庫列表,可依能力與熱度篩選

官方自 2025 年起提供雲端模型:帶 :cloud 後綴的模型(例如 glm-5.3:cloud)由 Ollama 託管在自有算力上執行,本機算力不足的裝置也能呼叫 753B 參數、1M 上下文等級的大型模型。雲端呼叫走 https://ollama.com/v1 或本機服務轉發,需註冊帳號並建立 API Key。

glm-5.3 模型詳情頁,標註雲端單價、上下文與參數規模

收費結構(以定價頁為準,截至 2026-10-02):

  • 本機執行:永久免費、不限量(官方原文 "Running models on your own hardware is always unlimited")。
  • Free $0:含少量入門用量,可付費購買 credits 解鎖全部雲端模型,按 token 結算。
  • Pro 20/月(或20/月(或200/年):含每月 $60 用量額度,可使用更大的 Pro 級模型。
  • Max $100/月:含每月 $300 額度、10 並發。
  • Team $500/月(early access):不限成員數,共享每月 $1,000 額度與集中管理。
  • Enterprise:客製報價,含模型存取控制與預算管理。

隱私與資料

依官方 FAQ 的說法:本機執行的提示詞與資料不離開本機;雲端模型會處理提示詞與回應以提供服務,但官方稱不儲存、不記錄內容、不用於訓練,僅蒐集基本帳號資訊與有限的用量中繼資料,且不出售資料。雲端模型託管於美國、歐洲與新加坡的設施。對資料敏感的場景可完全停用雲端功能、僅以本機模式運作。以上隱私承諾為官方自述,雲端場景建議搭配其隱私政策自行評估。

適用場景

  • 開發者在本機搭建不依賴外部 API 的大模型環境,為現有應用提供 OpenAI 相容端點。
  • 對資料隱私有要求的個人或團隊,在內網或離線環境執行開源模型。
  • 用程式代理(Claude Code、Codex、OpenCode 等)驅動開放權重模型,控制 token 成本。
  • 需要透過 Modelfile 固化系統提示與參數、向他人分發客製模型的場景。
  • 本機算力不足但想呼叫開放權重旗艦模型的使用者,可按量使用雲端 :cloud 模型。

局限

  • 本機執行大型模型對顯存/記憶體與磁碟要求高,模型檔案動輒數十至數百 GB;記憶體較小的裝置只能執行小參數模型。
  • 預設上下文窗口為 4096 tokens,長文本場景需手動調大 OLLAMA_CONTEXT_LENGTH 或 num_ctx,且會明顯增加記憶體佔用。
  • Intel Mac 僅支援 CPU 推論,速度較慢;Linux 無官方圖形介面,需習慣命令列操作。
  • 雲端模型按 token 計費且需註冊帳號,內容需經 Ollama 伺服器處理(官方稱不儲存、不訓練,屬單方承諾)。
  • 模型品質取決於所選開源模型本身,Ollama 僅負責執行與分發,不對模型能力背書。

參考資料