零基礎入門 · 小白三千問

為什麼有的 AI「看不懂」圖片?

你可能遇到過:給 AI 發照片,它回「唔好意思,請用文字描述」。也見過能把照片裏的菜譜都認出來的。同樣是 AI,差在哪?

一句話回答

因為「會説話」和「會看」是兩套獨立的本事。語言模型天生只認文字;想讓它看圖,得額外給它裝一雙「眼睛」——裝了的叫多模態模型,沒裝的就只能對圖片説抱歉。

小實驗 · 給兩個模型各發一張貓的照片
模型 A · 純文本模型(沒裝眼睛)
🖼️ 貓咪照片.jpg
「唔好意思,我睇唔到圖片。請用文字描述吓圖片內容,我嚟幫你分析。」
模型 B · 多模態模型(裝了眼睛)
🖼️ 貓咪照片.jpg
「一隻橘貓趴在飄窗上曬太陽,右前爪壓着一個毛綫球。看它的體型……這位可能需要控制一下飲食了 😄」
原理 · 「眼睛」是怎麼裝上去的
✂️

第一步:把圖切碎

「眼睛」(視覺編碼器)把圖片切成許多小方塊,每塊轉譯成模型認識的「詞」——一張圖就變成了一段特殊的「文字」。

🔤

第二步:當話來接

轉譯完成後,圖片對模型來説就和一段話沒區別了,照常「接話茬」。所以看圖能力的本質,還是那台接話機器。

🏋️

為什麼不都裝上?

裝眼睛要用海量「圖 + 文」配對數據重新訓練,成本高、模型更大更貴。很多場景根本用不到看圖,純文本模型反而更快更便宜。

順帶説清一個常見的混淆:「看懂圖」和「畫出圖」也是兩回事。能看圖的模型不一定能生成圖片——前者是「眼睛」,後者是完全不同的「畫手」(下一頁就講它為什麼那麼貴)。你用的 AI 應用如果既能看又能畫,那是它在幕後同時接了好幾個不同的模型。

✅ 這一頁想和你分享的