權重是什麼?一個模型的全部本事
新聞裡天天說「某某模型開源了」。開源的到底是什麼?是程式碼嗎?其實主要是一個檔案:權重。搞清楚它是什麼,後面所有關於開源的爭論你都能自己判斷。
這一章的例子基本都取自 Qwen,先說清楚為什麼。
- 尺寸鋪得最全。Ollama 官方庫裡 Qwen3.5 一代從 0.8B 一直排到 122B,中間有 2B、4B、9B、27B、35B。本章後面每講到一檔裝置,都能對應上一個真能下載下來的檔案,不用換品牌湊數。
- 別人拿它當底座。DeepSeek-R1 放出的六個蒸餾版裡有四個用的是 Qwen 底座——這是第三方的選擇,不是自家宣傳。
- 它自己就是個反面教材。Qwen2.5 時期的 3B 和 72B 用過非標準許可證,正好拿來講「開源」這兩個字有多不可靠,這一節在第二節。
中文社群裡有人管它叫「源神」,開源之神。這是網友的戲稱,不是評價標準,也不代表它每一項都最強。本章拿它舉例是因為素材齊、方便動手,不是因為它最好。你學完這一章要拿到的是判斷標準,不是一個品牌名——同一套標準套到任何一家身上都應該照樣能用。
模型內部沒有規則、沒有知識庫、沒有 if-else。有的只是一個巨大的數字表格。下面這些格子裡的每個數,就是一個權重,顏色深淺表示它的絕對值大小。
上面是 36 個數。一個 Qwen3-8B 模型有 80 億個這樣的數。訓練的全部意義,就是把這幾十億個數從隨機值一點點調整到合適的值。調完了,參數凍結,模型就定型了。
每個權重佔多少位元組,取決於儲存精度。模型發布時通常用 FP16,也就是每個數佔 2 個位元組。所以檔案體積有一個很好記的估算:
80 億參數 × 2 位元組 = 160 億位元組 ≈ 16 GB
公式記住了,但它到底意味著什麼,拖一下就知道了。下面這個滑塊從 0.5B 拖到 2.4 兆,你可以順手切換儲存精度,看同一個模型的檔案是怎麼脹大和縮小的。
下面用一組真實的模型對比一下。這裡選 Qwen 系列做尺子,是因為它的尺寸譜系目前最完整,從 0.6B 一直到 2.4T 都有公開型號,同一個系列內部比較不會摻進架構差異的干擾。
儲存體積和執行時佔用是兩碼事。檔案 16 GB,不代表 16 GB 顯存就能跑起來。模型執行時還要額外開銷一塊地方存放對話的中間狀態,也就是Harness 核心篇講過的 KV Cache。算下來通常要在參數量的基礎上多留三到五成。
這一章最後有一頁互動工具,你可以直接選自己的顯示卡或者 Mac 型號,看能跑哪些模型。這裡先記住結論:看檔案大小估顯存,會低估。
把上面的事情串起來,權重的意義就清楚了。它不只是一個檔案,它是控制權。
反過來說,只提供 API 的模型,你租的是使用權。價格、可用性、什麼時候下線,都由對方決定。這個區別在做技術選型時會直接變成風險,也是下一節要拆的東西:各家嘴裡的「開源」,含義差得非常遠。