Ollama 與 LM Studio 怎麼上手
上一節算出了你能跑什麼,這一節把它裝起來。兩個工具,一個命令列一個圖形介面,第一次用十分鐘能跑通。
Ollama
- 一條命令下載並執行,沒有多餘步驟
- 裝好後自動在後臺提供服務,可以直接被程式呼叫
- 介面相容 OpenAI 的格式,原來調 API 的程式碼改個地址就能用
- 沒有圖形介面,換模型、調參數都要敲命令
LM Studio
- 內建模型瀏覽器,能看到體積和量化檔位再決定下不下
- 會提示當前機器能不能帶得動,對新手很友好
- 也能開本地伺服器,同樣相容 OpenAI 格式
- 在 Apple 晶片上支援 MLX 引擎,比通用格式更快
裝好 Ollama 之後,只需要一條命令。以上一節算出你能跑 8B 為例:
ollama run qwen3:8b
就這一句。本地沒有就先下載,下完自動進入對話。想只下載不執行,把 run 換成 pull。其餘常用命令:
# 看已經下載了哪些模型,以及各佔多少空間
ollama list
# 刪掉不用的,本地模型很佔硬碟
ollama rm qwen3:8b
# 看當前正在佔用顯存的模型
ollama ps
裝好後 Ollama 會在本機 11434 埠提供服務,介面格式跟 OpenAI 一致。也就是說你手上現成的 OpenAI 呼叫程式碼,把 base_url 指過來就能跑,模型名填標籤名即可。
from openai import OpenAI
# 本地服務不校驗金鑰,api_key 隨便填一個非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "用一句話解釋什麼是量化"}],
)
print(resp.choices[0].message.content)
上面那條命令裡的 8b 是舉例。你自己該敲哪個數字,取決於你的機器。選一下,下面直接給出你能複製走的那條。
把上面那個選擇器裡的機型換著點一遍,會看出一件反直覺的事:決定你能跑多大模型的不是顯示卡多貴,是顯存多大。一張 RTX 4090 停在 30B,而一臺統一記憶體 128 GB 的 Mac 能吃下 122B——後者的圖形算力遠不如前者,但模型裝得進去,前者裝不進去。
- RTX 4090(24 GB 顯存)→ 最大 Qwen3-30B-A3B,需 19.5 GB
- Mac 統一記憶體 128 GB(約 96 GB 可用)→ 最大 Qwen3.5-122B-A10B,需 79.3 GB
這也是大記憶體 Mac 在本地跑模型這件事上唯一說得通的理由。它的優勢不是快,是裝得下:同樣的錢買獨顯,顯存到 24 GB 就到頭了,而統一記憶體能堆到 128 GB 以上,中間這一段沒有別的消費級裝置能補。如果你的用途就是在本地跑大尺寸模型,記憶體容量比 GPU 型號重要得多。
冒號後面那串不是隨便寫的,每一段都有含義。
ollama.com/library 對應模型的 tags 頁確認當前有哪些尺寸與檔位。核對日期 2026-08-07。
在模型庫裡搜尋
搜模型名,列表會列出各個量化版本的體積。介面會根據你的機器提示哪些帶得動,這一點比命令列直觀很多。
下載後直接聊天
載入模型時可以調上下文長度和 GPU 分配。這兩個參數直接影響顯存佔用,先用預設值跑通再調。
需要給程式呼叫時,開本地伺服器
在伺服器面板裡啟動,同樣是 OpenAI 相容介面,用法和上面的 Ollama 例子一樣,只是埠不同。
Mac 使用者注意選 MLX 版本
如果模型有 MLX 格式,優先選它。這是針對 Apple 晶片最佳化的引擎,同樣的模型速度會明顯好於通用格式。
- 上下文開太大,顯存直接爆。這是最高頻的問題。模型載入時顯存看著夠,一旦把上下文拉到幾十 K,KV Cache 漲上來就崩了。現象是生成到一半卡死,或者速度突然慢到不可用。先按預設上下文跑通,需要長文再一檔一檔往上加。
- 顯存不夠時不一定報錯。有些工具會自動把裝不下的部分放到記憶體裡,靠 CPU 算。結果是能跑,但慢十倍以上。如果你發現生成速度慢得離譜,先檢查是不是沒完全裝進顯存。
- 硬碟會被吃掉。一個 8B 的 Q4 模型三四個 GB,試幾個模型就是幾十個 GB。定期用
ollama list看一眼,不用的刪掉。
到這裡,你手上有三種用模型的方式了。它們不是替代關係,各有各的場合:
- 本地跑。資料不能外發、要長期高頻呼叫、或者想完全不受服務商影響時。代價是能力上限受硬體限制。
- 官方 API。要最強能力、不想管運維時。按量付費,用多少算多少。
- 中轉站。便利性和風險並存,具體的取捨在《什麼是 API 中轉站》那一節講過,涉及資料經手第三方的問題,選之前建議回去再看一眼。
這一章到此結束。你現在應該能自己判斷一個模型的開放程度、知道小模型是怎麼來的和它的代價、並且能在自己的機器上把它跑起來。