開源專題 · 在自己的機器上跑起來

Ollama 與 LM Studio 怎麼上手

上一節算出了你能跑什麼,這一節把它裝起來。兩個工具,一個命令列一個圖形介面,第一次用十分鐘能跑通。

先選工具

Ollama

命令列
  • 一條命令下載並執行,沒有多餘步驟
  • 裝好後自動在後臺提供服務,可以直接被程式呼叫
  • 介面相容 OpenAI 的格式,原來調 API 的程式碼改個地址就能用
  • 沒有圖形介面,換模型、調參數都要敲命令
適合你,如果:你要把本地模型接進自己的程式,或者習慣用終端。

LM Studio

圖形介面
  • 內建模型瀏覽器,能看到體積和量化檔位再決定下不下
  • 會提示當前機器能不能帶得動,對新手很友好
  • 也能開本地伺服器,同樣相容 OpenAI 格式
  • 在 Apple 晶片上支援 MLX 引擎,比通用格式更快
適合你,如果:你想先試幾個模型比較一下,或者不想碰命令列。
不用糾結,兩個可以都裝。它們下載的模型檔案互不衝突,很多人用 LM Studio 挑模型和試效果,用 Ollama 跑常駐服務。
Ollama:從零到跑通

裝好 Ollama 之後,只需要一條命令。以上一節算出你能跑 8B 為例:

下載並直接開始對話
ollama run qwen3:8b

就這一句。本地沒有就先下載,下完自動進入對話。想只下載不執行,把 run 換成 pull。其餘常用命令:

日常管理
# 看已經下載了哪些模型,以及各佔多少空間
ollama list

# 刪掉不用的,本地模型很佔硬碟
ollama rm qwen3:8b

# 看當前正在佔用顯存的模型
ollama ps

裝好後 Ollama 會在本機 11434 埠提供服務,介面格式跟 OpenAI 一致。也就是說你手上現成的 OpenAI 呼叫程式碼,把 base_url 指過來就能跑,模型名填標籤名即可。

用現成的 OpenAI SDK 調本地模型
from openai import OpenAI

# 本地服務不校驗金鑰,api_key 隨便填一個非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

resp = client.chat.completions.create(
    model="qwen3:8b",
    messages=[{"role": "user", "content": "用一句話解釋什麼是量化"}],
)
print(resp.choices[0].message.content)

上面那條命令裡的 8b 是舉例。你自己該敲哪個數字,取決於你的機器。選一下,下面直接給出你能複製走的那條。

選完直接點複製,這條命令裝好 Ollama 就能用。
平臺
型號
主要用途

把上面那個選擇器裡的機型換著點一遍,會看出一件反直覺的事:決定你能跑多大模型的不是顯示卡多貴,是顯存多大。一張 RTX 4090 停在 30B,而一臺統一記憶體 128 GB 的 Mac 能吃下 122B——後者的圖形算力遠不如前者,但模型裝得進去,前者裝不進去。

同樣是 INT4,兩臺機器的上限

這也是大記憶體 Mac 在本地跑模型這件事上唯一說得通的理由。它的優勢不是快,是裝得下:同樣的錢買獨顯,顯存到 24 GB 就到頭了,而統一記憶體能堆到 128 GB 以上,中間這一段沒有別的消費級裝置能補。如果你的用途就是在本地跑大尺寸模型,記憶體容量比 GPU 型號重要得多。

上面的推薦只登記了 Ollama 官方庫裡確實存在的標籤,核對日期 2026-08-07,來源 ollama.com/library。給一條拉不下來的命令比不給更糟。
標籤怎麼讀

冒號後面那串不是隨便寫的,每一段都有含義。

qwen3:30b-a3b-q4_K_M
qwen3模型系列名。
30b-a3b尺寸。帶 a 的是 MoE,這裡表示總參數 30B、啟用 3B。上一節講過,顯存要按 30B 準備。
q4_K_M量化檔位。不寫的話會用預設檔,見下一段。
第一個坑:你跑的預設就是量化版。不寫量化字尾時,Ollama 拉的通常是 Q4 檔,不是原始精度。很多人拿它跟官方 API 的效果比,覺得開源模型不行,其實比的根本不是同一個東西。要對比品質,先確認兩邊跑的是不是同一個檔位。
量化檔位怎麼選
Q4_K_M
預設選它。體積和品質的平衡點,絕大多數工具的預設檔。日常問答、總結、改寫這類任務上夠用。
Q5_K_M
體積略大,品質更穩。如果你主要拿來寫程式碼或做數學題,選這一檔更保險,這兩類任務對精度損失比較敏感。
Q8_0
接近原始品質,體積也接近翻倍。顯存充裕又想要最好效果時用。
Q3 及以下
除非顯存實在不夠,否則不建議。掉分開始明顯,還不如換個小一號的模型跑高一檔量化。
一條實用規律:模型越大,量化越安全。32B 模型量化到 Q4 掉的那點分,往往還是比 8B 跑 Q8 強。所以顯存有限時,優先保尺寸,再考慮檔位。
可用標籤會隨版本更新,實際拉取前建議到 ollama.com/library 對應模型的 tags 頁確認當前有哪些尺寸與檔位。核對日期 2026-08-07。
LM Studio:點幾下就行
1

在模型庫裡搜尋

搜模型名,列表會列出各個量化版本的體積。介面會根據你的機器提示哪些帶得動,這一點比命令列直觀很多。

2

下載後直接聊天

載入模型時可以調上下文長度和 GPU 分配。這兩個參數直接影響顯存佔用,先用預設值跑通再調。

3

需要給程式呼叫時,開本地伺服器

在伺服器面板裡啟動,同樣是 OpenAI 相容介面,用法和上面的 Ollama 例子一樣,只是埠不同。

4

Mac 使用者注意選 MLX 版本

如果模型有 MLX 格式,優先選它。這是針對 Apple 晶片最佳化的引擎,同樣的模型速度會明顯好於通用格式。

還有三個常見的坑
三條路,什麼時候走哪條

到這裡,你手上有三種用模型的方式了。它們不是替代關係,各有各的場合:

這一章到此結束。你現在應該能自己判斷一個模型的開放程度、知道小模型是怎麼來的和它的代價、並且能在自己的機器上把它跑起來。