開源專題 · 開源到底開的是什麼

權重是什麼?一個模型的全部本事

新聞裏天天説「某某模型開源了」。開源嘅到底係啲咩?係咪程式碼?其實主要是一個檔案:權重。搞清楚它是什麼,後面所有關於開源的爭論你都能自己判斷。

先説結論
權重就是模型訓練完之後留下的一堆數字。訓練花掉的幾千萬美元、幾個月的算力,最後全部凝結成這一個檔案。拿到它,你就能在自己的機器上跑出一模一樣的模型,不需要聯網,不需要向任何人付費。

這一章的例子基本都取自 Qwen,先説清楚為什麼。

中文社區裏有人管它叫「源神」,開源之神。這是網友的戲稱,不是評價標準,也不代表它每一項都最強。本章拿它舉例是因為素材齊、方便動手,不是因為它最好。你學完這一章要拿到的是判斷標準,不是一個品牌名——同一套標準套到任何一家身上都應該照樣能用。

它長什麼樣

模型內部沒有規則、沒有知識庫、沒有 if-else。有的只是一個巨大的數字表格。下面這些格子裏的每個數,就是一個權重,顏色深淺表示它的絕對值大小。

正值 負值 顏色越深,絕對值越大

上面是 36 個數。一個 Qwen3-8B 模型有 80 億個這樣的數。訓練的全部意義,就是把這幾十億個數從隨機值一點點調整到合適的值。調完了,參數凍結,模型就定型了。

這也解釋了大模型原理篇講過的那件事:模型跟你聊天時並不會學到任何東西。權重是訓練階段定死的,對話階段只讀不寫。你告訴它的事,它下次就忘了。
參數量決定檔案體積

每個權重佔多少字節,取決於存儲精度。模型發佈時通常用 FP16,也就是每個數佔 2 個字節。所以檔案體積有一個很好記的估算:

權重檔案體積(GB)≈ 參數量(B)× 2
80 億參數 × 2 字節 = 160 億字節 ≈ 16 GB

公式記住了,但它到底意味着什麼,拖一下就知道了。下面這個滑塊從 0.5B 拖到 2.4 萬億,你可以順手切換存儲精度,看同一個模型的檔案是怎麼脹大和縮小的。

把參數量拖到 8B,然後在 FP16 和 INT4 之間來回切一次。
參數量 8 B
存儲精度
16 GB

下面用一組真實的模型對比一下。這裏選 Qwen 系列做尺子,是因為它的尺寸譜系目前最完整,從 0.6B 一直到 2.4T 都有公開型號,同一個系列內部比較不會摻進架構差異的干擾。

Qwen3-0.6B約 1.2 GB
Qwen3-8B約 16 GB
Qwen3-32B約 64 GB
Qwen3-235B-A22B約 470 GB
Qwen3.8-Max(2.4 萬億參數)數 TB 量級
參數規模來自各模型官方發佈説明;體積為 FP16 下的理論估算值,實際檔案會因分片方式與附帶的配置檔案略有出入。Qwen3.8-Max 總參數 2.4 萬億、激活 950 億,發佈於 2026-08-03。
一個容易混淆的地方

存儲體積和運行時佔用是兩碼事。檔案 16 GB,不代表 16 GB 顯存就能跑起來。模型運行時還要額外開銷一塊地方存放對話的中間狀態,也就是Harness 核心篇講過的 KV Cache。算下來通常要在參數量的基礎上多留三到五成。

這一章最後有一頁交互工具,你可以直接選自己的顯卡或者 Mac 型號,看能跑哪些模型。這裏先記住結論:看檔案大小估顯存,會低估。

為什麼權重這麼關鍵

把上面的事情串起來,權重的意義就清楚了。它不只是一個檔案,它是控制權。

離綫
不依賴任何服務商
拔掉網綫也能跑,對方漲價、限流、下架都影響不到你
可改
能在它基礎上繼續訓練
用自己的數據微調出一個專屬版本,這是調 API 做不到的
留痕
數據不出自己的機器
醫療、法務、內部程式碼這類不能外發的場景,只有這一條路

反過來説,只提供 API 的模型,你租的是使用權。價格、可用性、什麼時候下綫,都由對方決定。這個區別在做技術選型時會直接變成風險,也是下一節要拆的東西:各家嘴裏的「開源」,含義差得非常遠。